Generatívne video

Video diffusion model

videodifúzny model

Video diffusion model vytvára sekvenciu snímok tým, že sa naučí reverzný proces k postupnému pridávaniu šumu do videa, často s podmienkou vo forme textu, obrazu alebo pohybového signálu. Oproti obrazovej difúzii musí modelovať aj temporal coherence, pohyb objektov, kameru a identitu naprieč časom. Architektúra môže používať priestorovo-časové attention bloky, latentný priestor alebo kaskádu rozlíšení. Kvalita sa neposudzuje iba ostrosťou snímok, ale aj fyzikálnou konzistenciou, kontinuitou a zhodou s promptom.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-13

Odborná definícia

Odborná definícia

Video diffusion model vytvára sekvenciu snímok tým, že sa naučí reverzný proces k postupnému pridávaniu šumu do videa, často s podmienkou vo forme textu, obrazu alebo pohybového signálu. Oproti obrazovej difúzii musí modelovať aj temporal coherence, pohyb objektov, kameru a identitu naprieč časom. Architektúra môže používať priestorovo-časové attention bloky, latentný priestor alebo kaskádu rozlíšení. Kvalita sa neposudzuje iba ostrosťou snímok, ale aj fyzikálnou konzistenciou, kontinuitou a zhodou s promptom.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Obrazový difúzny model vytvorí jednu fotografiu zo šumu. Videodifúzny model musí súčasne vytvoriť mnoho snímok tak, aby sa postava, pozadie a smer pohybu medzi nimi nerozpadli. Ak každú snímku nakreslí dobre, ale nezávisle, tvár môže meniť tvar a predmet preskakovať. Model preto spracúva aj časovú os a učí sa, ako sa scéna mení. Dlhšie video je náročnejšie, pretože drobná chyba v identite alebo geometrii sa môže s každým ďalším krokom zväčšovať.

Časté otázky

Časté otázky

Ako sa video diffusion líši od image-to-video modelu?

Video diffusion opisuje generatívny mechanizmus. Image-to-video je typ podmienenia, pri ktorom prvý obraz určuje vzhľad alebo počiatočný stav sekvencie.

Čo znamená temporal consistency?

Objekty si zachovávajú identitu, geometriu, osvetlenie a logický pohyb medzi snímkami. Bez nej video bliká alebo mení detaily bez príčiny.

Prečo sa video často generuje v latentnom priestore?

Priame spracovanie pixelov naprieč časom je veľmi drahé. Komprimovaný latentný priestor znižuje pamäť a počet výpočtov pri zachovaní hlavných štruktúr.

Ako sa hodnotí generované video?

Používajú sa perceptuálne a distribučné metriky, zhoda s textom, temporal coherence, preferencie hodnotiteľov a testy identity či fyzikálnych porušení.

Aké riziká prináša videodifúzia?

Uľahčuje tvorbu presvedčivých syntetických scén, imitáciu osôb a dezinformácie. Potrebné sú pravidlá súhlasu, provenance, označovanie a detekčné mechanizmy.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Video Diffusion Models Imagen Video: High Definition Video Generation with Diffusion Models

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.