Generatívne modely pre vizuálny obsah

Image generation

Generovanie obrázkov

Image generation je syntéza nového obrazového výstupu modelom na základe naučenej distribúcie a voliteľnej podmienky, napríklad textu, masky, náčrtu, referenčného obrazu alebo triedy. Difúzne modely postupne odstraňujú šum z latentnej či pixelovej reprezentácie, GAN používajú súťaž generátora a diskriminátora a autoregresívne systémy predikujú obrazové tokeny. Výstup nie je jednoduchou kópiou jedného tréningového záznamu, no môže reprodukovať zapamätané prvky alebo stereotypy dát. Hodnotenie zahŕňa vernosť podmienke, vizuálnu kvalitu, rozmanitosť, bezpečnosť, pôvod a riziko zavádzajúceho použitia.

Posledná odborná revízia
29. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-05

Odborná definícia

Odborná definícia

Image generation je syntéza nového obrazového výstupu modelom na základe naučenej distribúcie a voliteľnej podmienky, napríklad textu, masky, náčrtu, referenčného obrazu alebo triedy. Difúzne modely postupne odstraňujú šum z latentnej či pixelovej reprezentácie, GAN používajú súťaž generátora a diskriminátora a autoregresívne systémy predikujú obrazové tokeny. Výstup nie je jednoduchou kópiou jedného tréningového záznamu, no môže reprodukovať zapamätané prvky alebo stereotypy dát. Hodnotenie zahŕňa vernosť podmienke, vizuálnu kvalitu, rozmanitosť, bezpečnosť, pôvod a riziko zavádzajúceho použitia.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Používateľ zadá opis horskej chaty počas modrej hodiny. Model začne z náhodnej reprezentácie a v mnohých krokoch ju mení tak, aby výsledok zodpovedal slovám aj obrazovým vzorom naučeným počas tréningu. Pri rovnakom texte môže iné počiatočné semeno vytvoriť odlišnú kompozíciu. Model však nerozumie fyzike ako architekt, preto môže pokaziť konštrukciu, nápis alebo počet predmetov. Pri komerčnom nasadení sa navyše rieši licencia tréningových dát, označenie syntetického obsahu a ochrana pred vytvorením klamlivej imitácie reálnej osoby.

Časté otázky

Časté otázky

Čo riadi rozdiel medzi dvoma výstupmi z rovnakého promptu?

Náhodné semeno, parametre vzorkovania, počet krokov, guidance a verzia modelu menia cestu generovania. Fixované nastavenia zvyšujú reprodukovateľnosť, hoci hardvér alebo implementácia môžu priniesť drobné odchýlky.

Prečo generátor často zlyháva pri texte v obrázku?

Písmená sú presné diskrétne symboly, zatiaľ čo model optimalizuje vizuálnu pravdepodobnosť a súlad s promptom. Novšie architektúry sa zlepšujú, no dlhé nápisy a konzistentná typografia zostávajú náročné.

Ako sa meria súlad obrázka s textom?

Používajú sa multimodálne skóre, ľudské porovnania a testovacie prompty s kontrolovanými vlastnosťami. Jediné podobnostné číslo môže prehliadnuť nesprávny počet, priestorový vzťah alebo bezpečnostný problém.

Čo je negatívny prompt?

Je zoznam nežiaducich vlastností, ktoré majú pri niektorých systémoch znížiť pravdepodobnosť príslušných vizuálnych znakov. Účinok závisí od architektúry a nemožno ho chápať ako spoľahlivú bezpečnostnú bariéru.

Môže obrazový model prezradiť tréningový obrázok?

Pri určitých dátach a promptoch môže dôjsť k memorovaniu alebo veľmi blízkej reprodukcii. Riziko sa skúma deduplikačnými testami, útokmi na extrakciu, porovnaním podobnosti a politikou používania zdrojov.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Rombach a kol., High-Resolution Image Synthesis with Latent Diffusion Models (arxiv.org)
  • NIST AI 100-4, Reducing Risks Posed by Synthetic Content (doi.org)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.