Vision-language modely

Klasifikace obrazu pomocí textových tříd bez dolaďování

Zero-shot image classification přiřazuje obraz k triedam definovaným textem bez optimalizace modelu na označených obrázcích těchto tříd. Vision-language model zakóduje obraz a textové prompty do společného prostoru, vypočítá podobnost a zvolí najbližšiu reprezentaci. Při CLIP se pro každou třídu často používá více promptových šablón a jejich embeddingy se agregují. Výkon závisí na názvů tříd, domény, jazyka, kalibrace teploty a od prekryvu mezi predtrénovacími daty a testem.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Z-19

Odborná definice

Odborná definice

Zero-shot image classification přiřazuje obraz k triedam definovaným textem bez optimalizace modelu na označených obrázcích těchto tříd. Vision-language model zakóduje obraz a textové prompty do společného prostoru, vypočítá podobnost a zvolí najbližšiu reprezentaci. Při CLIP se pro každou třídu často používá více promptových šablón a jejich embeddingy se agregují. Výkon závisí na názvů tříd, domény, jazyka, kalibrace teploty a od prekryvu mezi predtrénovacími daty a testem.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Místo nové klasifikačnej hlavy pripravíte texty jako fotografie mačky, fotografie psa a röntgen plúc. Model porovná vizuální embedding s každým textovým embeddingom. Je to flexibilné, protože třídy lze měnit bez tréninku, ale text je zároveň součástí modelu. Odborný název, skratka a běžné pomenování mohou vést k rozdílným skóre. Při medicíne nebo priemysle nemusí webové předtrénování zachytit jemné diagnostické znaky, proto se výsledek nesmí zaměnit za validovaný odborný klasifikátor.

Časté otázky

Časté otázky

Proč se používá prompt ensembling?

Více prirodzených šablón snižuje citlivost na jednu formulaci a vytváří stabilnejšiu textovou reprezentaci třídy.

Musí být seznam tříd uzavretý?

Pro konkrétní výpočet ano, skóre se porovnává mezi zadanými kandidátmi. Seznam lze měnit při každém volaní.

Je nejvyšší skóre pravděpodobnost?

Ne automaticky. Softmax nad podobnostmi je relativní vůči zvoleným triedam a nemusí být kalibrovaný jako reálna pravděpodobnost správnosti.

Jako řešit hierarchické třídy?

Lze použít viacúrovňové prompty nebo nejprve širokou a potom jemnou klasifikaci, přičemž se validuje konzistentnost mezi úrovňami.

Co testovat před nasazením?

Doménové obrázky, alternatívne názvy, out-of-distribution vstupy, citlivost na pozadí a výkon na podskupinách relevantních uživatelů.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • OpenAI, CLIP
  • OpenAI CLIP repository

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.