Multimodální reprezentace

Společné vektorové vnoření více modalit nebo pohladů

Joint embedding je reprezentace, ve které se objekty z různých modalit, domén nebo pohladů mapují do zdielaného vektorového prostoru tak, aby sémanticky související položky ležali blízko. Typickým příkladem jsou páry obrázek a text, uživatel a položka nebo otázka a odpověď. Enkodéry mohou být odlišné, ale tréninkový cíl zosúlaďuje jejich výstupy kontrastívnou, metrickou nebo predikčnou ztrátou. Geometrie prostoru umožňuje cross-modal retrieval a zero-shot přenos. Kvalita závisí na párování dat, negativních příkladů, normalizace a významu použitej vzdálenosti.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-J-18

Odborná definice

Odborná definice

Joint embedding je reprezentace, ve které se objekty z různých modalit, domén nebo pohladů mapují do zdielaného vektorového prostoru tak, aby sémanticky související položky ležali blízko. Typickým příkladem jsou páry obrázek a text, uživatel a položka nebo otázka a odpověď. Enkodéry mohou být odlišné, ale tréninkový cíl zosúlaďuje jejich výstupy kontrastívnou, metrickou nebo predikčnou ztrátou. Geometrie prostoru umožňuje cross-modal retrieval a zero-shot přenos. Kvalita závisí na párování dat, negativních příkladů, normalizace a významu použitej vzdálenosti.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Obrázek psa a věta „hnedý pes beží po tráve“ mají zcela odlišnou surovou formu. Dva enkodéry jejich však mohou previesť na vektory v tom istom prostoru. Pokud se během tréninku správně páry priťahují a nesúvisiace od sebe odtláčají, textový dotaz později najde vhodný obrázek bez klasifikátora pro každou kategorii. Vektorová blízkost neznamená, že modalita obsahuje stejné detaily. Znamená pouze, že tréninkový cíl jejich považuje za zodpovedajúce podle dostupných párů a negativních příkladů.

Časté otázky

Časté otázky

Musí mít enkodéry stejnou architekturu?

Ne. Obraz může zpracovat vision transformer a text jazykový transformer. Důležité je, aby projekčné hlavy vytvořili vektory kompatibilného rozmeru a trénink definoval společnou geometrii.

Jak se joint embedding trénuje?

Často kontrastívnou ztrátou nad batchom párů. Správný obraz a text mají vysokou podobnost, ostatní kombinace slouží jako negatíva. Alternatívou je triplet loss, klasifikační cíl nebo predikce latentní reprezentace.

Co je hubness v embeddingovom prostoru?

Některé vektory se stanou najbližšími susedmi nepřiměřeně velkého počtu dotazů, zejména ve vysokém rozmere. Zhoršuje to retrieval a může souviset s anisotropiou, distribučným posunom nebo nevhodnou metrikou.

Lze prostor použít na zero-shot klasifikaci?

Ano. Vytvoří se textové reprezentace názvů nebo opisů tříd a obraz se přiřadí k najbližšej. Výkon závisí na promptu, tréninkového pokrytí a toho, či podobnost reprezentuje požadovanou taxonomii.

Jak se hodnotí kvalita?

Používá se recall@k, median rank, zero-shot accuracy a analýza sousedů. Důležité je testovat obě směry vyhledávání, různé podskupiny a odolnost vůči duplicitám nebo skratkovým koreláciám.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Radford a kol., CLIP

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.