Generování obrazu a multimodální obsah

Latentní difuzní model

Latent diffusion model, LDM, provádí difuzní proces ne přímo v pixelovom prostoru, ale v komprimovanej latentní reprezentaci vytvorenej autoenkóderom. Trénink se učí odstraňovat šum z latentů v postupných časových krocích. Podmínky, například text, maska nebo třída, se mohou pripájat přes cross-attention. Po dokončení denoisingu dekóder převede latent zpět na obraz. Komprese snižuje výpočtovou náročnost, ale kvalitu a typ artefaktů ovlivňuje i autoenkóder.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-11

Odborná definice

Odborná definice

Latent diffusion model, LDM, provádí difuzní proces ne přímo v pixelovom prostoru, ale v komprimovanej latentní reprezentaci vytvorenej autoenkóderom. Trénink se učí odstraňovat šum z latentů v postupných časových krocích. Podmínky, například text, maska nebo třída, se mohou pripájat přes cross-attention. Po dokončení denoisingu dekóder převede latent zpět na obraz. Komprese snižuje výpočtovou náročnost, ale kvalitu a typ artefaktů ovlivňuje i autoenkóder.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Místo toho, aby generátor upravoval milióny pixelů, nejprve pracuje s menšou mapou, která zachycuje podstatné vizuálně črty. Z náhodného šumu v této mape opakovaně odebírá šum podle textového zadání. Až na konci preloží výslednou latentnou reprezentaci zpět na obrázek. Tento postup je lacnejší než difúze v plném rozlišení. Zároveň znamená, že drobné textúry, písmo nebo přesné tvary mohou být limitované tím, co kompresný dekóder dokáže verne obnovit.

Časté otázky

Časté otázky

Proč se difúze presúva do latentního prostoru?

Snižuje prostorové rozměry a počet výpočtů. Model může venovat kapacitu významové štruktúre bez denoisingu každého pixelu v plném rozlišení.

Jakou úlohu má autoenkóder?

Encoder převede obraz na latent a decoder ho rekonštruuje. Jeho kompresný poměr a kvalita určují, jaké detaily zůstanou dostupné difúznemu modelu.

Je textový encoder součástí difuze?

Je součástí podmieneného systému, ale může být samostatně předtrénovaný. Jeho embeddingy vstupují do denoising sítě, často přes cross-attention.

Co je classifier-free guidance?

Při generování kombinuje podmienenou a nepodmienenou predikci šumu. Vyšší guidance posilní soulad s promptem, ale může snížit prirodzenost nebo rozmanitost.

Proč LDM špatně kreslí malé písmo?

Přesné znaky vyžadují jemnou prostorovou strukturu a konzistentnou sekvenci. Komprese i generativní cíl uprednostňují vizuálnu pravděpodobnost před typografickou správností.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.