Multimodální generace a porozumění obrazu

Automatické popisování obrázků

Image captioning je úloha, při které model vytvoří prirodzenojazykový popis vizuálního vstupu. Systém musí rozpoznat objekty, vlastnosti, činnosti a vztahy, vybrat významné prvky scény a usporiadat jejich do gramaticky správné věty nebo dlhšieho textu. Moderní řešení spojují obrazový enkóder s autoregresívnym jazykovým dekóderom nebo používají jednotný multimodální model. Kvalita se neposudzuje pouze podle podobnosti s referenčnými vetami, protože jeden obrázek může mít více správných opisů. Kritické jsou faktická věrnost, pokrytí a absence vymyslených objektů.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-02

Odborná definice

Odborná definice

Image captioning je úloha, při které model vytvoří prirodzenojazykový popis vizuálního vstupu. Systém musí rozpoznat objekty, vlastnosti, činnosti a vztahy, vybrat významné prvky scény a usporiadat jejich do gramaticky správné věty nebo dlhšieho textu. Moderní řešení spojují obrazový enkóder s autoregresívnym jazykovým dekóderom nebo používají jednotný multimodální model. Kvalita se neposudzuje pouze podle podobnosti s referenčnými vetami, protože jeden obrázek může mít více správných opisů. Kritické jsou faktická věrnost, pokrytí a absence vymyslených objektů.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Fotografie může zobrazovat dieťa v žltej bunde, které krmi kačky při jazere. Model nejprve převede obraz na reprezentace oblastí a potom vytvoří větu, která zachytí najdůležitejšiu událost. Nemusí uvést každý strom ani odtieň oblohy, ale nemal by si vymyslieť psa, který na zábere není. Úloha je náročnejšia než seznam predmetů, protože popis musí vyjadrit, kdo co dělá a kde se to deje. V přístupnosti může takový text pomoci uživateli se zrakovým znevýhodnením, proto je důležitá přesnost i primeraná úroveň detailu.

Časté otázky

Časté otázky

Jaký je rozdíl mezi image captioning a detekcí objektů?

Detekce objektů vrací třídy a polohy vybraných predmetů. Captioning z nich vytváří jazykový souhrn scény, přičemž musí zachytit vztahy, činnost a informační prioritu, ne pouze přítomnost objektů.

Proč metriky BLEU nebo Cider nestačia samostatně?

Porovnávají n-gramy nebo konsenzus referenčních opisů, ale mohou odmenit větu s podobným slovníkem a nesprávnym významom. Vecná správnost se proto doplňa ludským hodnotením nebo metrikami citlivými na objekty a vztahy.

Co je halucinace při popisování obrázku?

Jde o zmienku o predmete, vlastnosti nebo události, kterou vizuální vstup nepodporuje. Může vzniknout z jazykových stereotypů, například když model při kuchynskej scéne automaticky doplní sporák, ačkoli ho nevidno.

Jak se nastaví délka opisu?

Dekódování lze omezit počtem tokenů, štýlovou inštrukcí nebo tréninkem na různých úrovniach detailu. Pro alt text je vhodný stručný funkčný popis, při dokumentaci může být potřebný viacvetný přehled.

Jaké data se používají na trénink captioningu?

Nejčastěji páry obrázek a lidský popis. Kvalitu ovlivňuje rozmanitost scén, přesnost anotací a to, či opisy zachycují pozorovatelné fakta. Automaticky zozbierané titulky mohou obsahovat šum nebo kontext mimo obrazu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Vinyals a kol., Show and Tell: A Neural Image Caption Generator (arxiv.org) Microsoft COCO Captions (cocodataset.org)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.