Multimodální generativní AI

Text-to-image model

Text-to-image model generuje obraz podmíněný textovým popisem, případně ďalšími vstupmi, jako jsou maska, referenční obraz nebo štýlové parametry. Moderní systémy často kombinují textový encoder s difúznym nebo autoregresívnym generátorom a pracují v pixelovom či latentním prostoru. Text neurčuje jednoznačný obraz, proto výstup závisí na náhodného šumu a tréninkového rozdělení. Model může nesprávně zobrazit počet objektů, text v obraze, prostorové vztahy nebo identitu. Při reprodukcii se eviduje seed, model, sampler, počet kroků, rozlišení a všechny podmienkové vstupy.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-13

Odborná definice

Odborná definice

Text-to-image model generuje obraz podmíněný textovým popisem, případně ďalšími vstupmi, jako jsou maska, referenční obraz nebo štýlové parametry. Moderní systémy často kombinují textový encoder s difúznym nebo autoregresívnym generátorom a pracují v pixelovom či latentním prostoru. Text neurčuje jednoznačný obraz, proto výstup závisí na náhodného šumu a tréninkového rozdělení. Model může nesprávně zobrazit počet objektů, text v obraze, prostorové vztahy nebo identitu. Při reprodukcii se eviduje seed, model, sampler, počet kroků, rozlišení a všechny podmienkové vstupy.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Uživatel napíše popis scény a model ho převede na číselnou reprezentaci, která usmerňuje postupné vytvárání obrazu. Při difúznom prístupe se začíná šumem a v mnoha krocích se odstraňuje šum tak, aby výsledek zodpovedal textu. Stejný popis může vést k různym kompozíciám, protože počiatočný šum se mění. Model ví dobře napodobnit vizuálně vzory z tréninku, ale nerozumie fyzike a počítání jako grafický editor. Přesná značka, rozložení či text často vyžadují další nástroje a kontrolu. I vizuálně přesvědčivý obrázek se musí kontrolovat po detailoch, protože malé chyby mohou změnit význam scény.

Časté otázky

Časté otázky

Co je classifier-free guidance?

Je to technika, která kombinuje podmienenou a nepodmienenou predikci během difuze. Vyšší guidance může posilnit soulad s promptem, ale snížit prirodzenost nebo rozmanitost.

Proč model špatně kreslí písmená?

Učí se vizuálně vzory textu jako součást obrazu, ne vždy jako přesnou sekvenci znaků s typografickými pravidly. Přesné nápisy je bezpečnejšie doplnit editorom.

Co je negativní prompt?

Popisuje prvky, kterým se má generování vyhnúť. Účinek závisí na architektury a implementace a není zárukou úplného odstranění daného prvku.

Jak se zachová stejná postava ve více obrázcích?

Používá se referenční obraz, identity adapter, dolaďování nebo kontrolní reprezentace. Samotné opakování mena v textu konzistentnou identitu nezaručuje.

Jaké rizika je třeba kontrolovat před publikováním?

Autorské a osobnostné práva, zobrazení reálných lidí, zavádzajúci obsah, stereotypy, citlivé symboly a původ použitých referencií. Důležité je i označení syntetického obsahu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • High-Resolution Image Synthesis with Latent Diffusion Models Zero-Shot Text-to-Image Generation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.