Generatívna AI

Difúzny model

Diffusion model

Difúzny model je generatívny model, ktorý sa učí obrátiť postupný proces pridávania šumu do dát. Počas tréningu dostáva vzorky z rôznych úrovní zašumenia a učí sa odhadovať šum, čistú vzorku alebo skóre distribúcie. Pri generovaní začína náhodným šumom a opakovanými denoising krokmi vytvára obraz, zvuk alebo inú štruktúru. Podmienenie textom, triedou či ďalším vstupom usmerňuje výsledok. Kvalita závisí od tréningového korpusu, reprezentácie, sampleru, počtu krokov a spôsobu riadenia podmienky.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-17

Odborná definícia

Odborná definícia

Difúzny model je generatívny model, ktorý sa učí obrátiť postupný proces pridávania šumu do dát. Počas tréningu dostáva vzorky z rôznych úrovní zašumenia a učí sa odhadovať šum, čistú vzorku alebo skóre distribúcie. Pri generovaní začína náhodným šumom a opakovanými denoising krokmi vytvára obraz, zvuk alebo inú štruktúru. Podmienenie textom, triedou či ďalším vstupom usmerňuje výsledok. Kvalita závisí od tréningového korpusu, reprezentácie, sampleru, počtu krokov a spôsobu riadenia podmienky.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Predstavte si fotografiu, do ktorej sa po malých dávkach pridáva zrno, až zostane iba náhodný šum. Model sleduje mnoho takýchto medzistavov a učí sa, akým smerom treba šum odoberať. Pri tvorbe nového obrazu ide opačne, z náhodnej plochy postupne vyťahuje štruktúru zodpovedajúcu textovému zadaniu. Nevyhľadáva konkrétny uložený obrázok, ale vzorkuje z naučenej distribúcie. Napriek tomu môže reprodukovať prvky tréningových dát, preto sú dôležité deduplikácia a testy memorovania.

Časté otázky

Časté otázky

Prečo generovanie difúznym modelom prebieha vo viacerých krokoch?

Každý krok odstráni iba časť šumu. Iteratívny proces aproximuje spätnú difúziu a umožňuje postupne formovať globálnu aj lokálnu štruktúru.

Čo je latent diffusion?

Proces denoisingu neprebieha priamo v pixeloch, ale v komprimovanom latentnom priestore autoenkódera, čo výrazne znižuje výpočtové náklady.

Ako text riadi obrazový výstup?

Textový enkóder vytvorí reprezentáciu promptu, ktorú denoising sieť využíva cez podmienenie, často mechanizmom cross attention.

Čo znamená guidance scale?

Určuje silu, s akou sa vzorkovanie prikláňa k textovej podmienke. Príliš vysoká hodnota môže znížiť prirodzenosť a zvýrazniť artefakty.

Sú difúzne modely vhodné iba na obrázky?

Nie. Používajú sa pri zvuku, videu, 3D štruktúrach, molekulách, časových radoch a ďalších typoch dát, kde možno definovať vhodný proces šumu.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.