Multimodálna generatívna AI

Text-to-image model

model text na obraz

Text-to-image model generuje obraz podmienený textovým opisom, prípadne ďalšími vstupmi, ako sú maska, referenčný obraz alebo štýlové parametre. Moderné systémy často kombinujú textový encoder s difúznym alebo autoregresívnym generátorom a pracujú v pixelovom či latentnom priestore. Text neurčuje jednoznačný obraz, preto výstup závisí od náhodného šumu a tréningového rozdelenia. Model môže nesprávne zobraziť počet objektov, text v obraze, priestorové vzťahy alebo identitu. Pri reprodukcii sa eviduje seed, model, sampler, počet krokov, rozlíšenie a všetky podmienkové vstupy.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-13

Odborná definícia

Odborná definícia

Text-to-image model generuje obraz podmienený textovým opisom, prípadne ďalšími vstupmi, ako sú maska, referenčný obraz alebo štýlové parametre. Moderné systémy často kombinujú textový encoder s difúznym alebo autoregresívnym generátorom a pracujú v pixelovom či latentnom priestore. Text neurčuje jednoznačný obraz, preto výstup závisí od náhodného šumu a tréningového rozdelenia. Model môže nesprávne zobraziť počet objektov, text v obraze, priestorové vzťahy alebo identitu. Pri reprodukcii sa eviduje seed, model, sampler, počet krokov, rozlíšenie a všetky podmienkové vstupy.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Používateľ napíše opis scény a model ho prevedie na číselnú reprezentáciu, ktorá usmerňuje postupné vytváranie obrazu. Pri difúznom prístupe sa začína šumom a v mnohých krokoch sa odstraňuje šum tak, aby výsledok zodpovedal textu. Rovnaký opis môže viesť k rôznym kompozíciám, pretože počiatočný šum sa mení. Model vie dobre napodobniť vizuálne vzory z tréningu, ale nerozumie fyzike a počítaniu ako grafický editor. Presná značka, rozloženie či text často vyžadujú ďalšie nástroje a kontrolu. Aj vizuálne presvedčivý obrázok sa musí kontrolovať po detailoch, pretože malé chyby môžu zmeniť význam scény.

Časté otázky

Časté otázky

Čo je classifier-free guidance?

Je to technika, ktorá kombinuje podmienenú a nepodmienenú predikciu počas difúzie. Vyššia guidance môže posilniť súlad s promptom, ale znížiť prirodzenosť alebo rozmanitosť.

Prečo model zle kreslí písmená?

Učí sa vizuálne vzory textu ako súčasť obrazu, nie vždy ako presnú sekvenciu znakov s typografickými pravidlami. Presné nápisy je bezpečnejšie doplniť editorom.

Čo je negatívny prompt?

Opisuje prvky, ktorým sa má generovanie vyhnúť. Účinok závisí od architektúry a implementácie a nie je zárukou úplného odstránenia daného prvku.

Ako sa zachová rovnaká postava vo viacerých obrázkoch?

Používa sa referenčný obraz, identity adapter, dolaďovanie alebo kontrolné reprezentácie. Samotné opakovanie mena v texte konzistentnú identitu nezaručuje.

Aké riziká treba kontrolovať pred publikovaním?

Autorské a osobnostné práva, zobrazenie reálnych ľudí, zavádzajúci obsah, stereotypy, citlivé symboly a pôvod použitých referencií. Dôležité je aj označenie syntetického obsahu.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • High-Resolution Image Synthesis with Latent Diffusion Models Zero-Shot Text-to-Image Generation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.