Odborná definícia
Odborná definícia
Image captioning je úloha, pri ktorej model vytvorí prirodzenojazykový opis vizuálneho vstupu. Systém musí rozpoznať objekty, vlastnosti, činnosti a vzťahy, vybrať významné prvky scény a usporiadať ich do gramaticky správnej vety alebo dlhšieho textu. Moderné riešenia spájajú obrazový enkóder s autoregresívnym jazykovým dekóderom alebo používajú jednotný multimodálny model. Kvalita sa neposudzuje iba podľa podobnosti s referenčnými vetami, pretože jeden obrázok môže mať viac správnych opisov. Kritické sú faktická vernosť, pokrytie a absencia vymyslených objektov.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Fotografia môže zobrazovať dieťa v žltej bunde, ktoré kŕmi kačky pri jazere. Model najprv prevedie obraz na reprezentácie oblastí a potom vytvorí vetu, ktorá zachytí najdôležitejšiu udalosť. Nemusí uviesť každý strom ani odtieň oblohy, no nemal by si vymyslieť psa, ktorý na zábere nie je. Úloha je náročnejšia než zoznam predmetov, pretože opis musí vyjadriť, kto čo robí a kde sa to deje. V prístupnosti môže taký text pomôcť používateľovi so zrakovým znevýhodnením, preto je dôležitá presnosť aj primeraná úroveň detailu.
Časté otázky
Časté otázky
Aký je rozdiel medzi image captioning a detekciou objektov?
Detekcia objektov vracia triedy a polohy vybraných predmetov. Captioning z nich vytvára jazykový súhrn scény, pričom musí zachytiť vzťahy, činnosť a informačnú prioritu, nie iba prítomnosť objektov.
Prečo metriky BLEU alebo CIDEr nestačia samostatne?
Porovnávajú n-gramy alebo konsenzus referenčných opisov, ale môžu odmeniť vetu s podobným slovníkom a nesprávnym významom. Vecná správnosť sa preto dopĺňa ľudským hodnotením alebo metrikami citlivými na objekty a vzťahy.
Čo je halucinácia pri opisovaní obrázka?
Ide o zmienku o predmete, vlastnosti alebo udalosti, ktorú vizuálny vstup nepodporuje. Môže vzniknúť z jazykových stereotypov, napríklad keď model pri kuchynskej scéne automaticky doplní sporák, hoci ho nevidno.
Ako sa nastaví dĺžka opisu?
Dekódovanie možno obmedziť počtom tokenov, štýlovou inštrukciou alebo tréningom na rôznych úrovniach detailu. Pre alt text je vhodný stručný funkčný opis, pri dokumentácii môže byť potrebný viacvetný prehľad.
Aké dáta sa používajú na tréning captioningu?
Najčastejšie páry obrázok a ľudský opis. Kvalitu ovplyvňuje rozmanitosť scén, presnosť anotácií a to, či opisy zachytávajú pozorovateľné fakty. Automaticky zozbierané titulky môžu obsahovať šum alebo kontext mimo obrazu.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Vinyals a kol., Show and Tell: A Neural Image Caption Generator (arxiv.org) Microsoft COCO Captions (cocodataset.org)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
