Multimodálne reprezentácie

Joint embedding

Spoločné vektorové vnorenie viacerých modalít alebo pohľadov

Joint embedding je reprezentácia, v ktorej sa objekty z rôznych modalít, domén alebo pohľadov mapujú do zdieľaného vektorového priestoru tak, aby sémanticky súvisiace položky ležali blízko. Typickým príkladom sú páry obrázok a text, používateľ a položka alebo otázka a odpoveď. Enkodéry môžu byť odlišné, no tréningový cieľ zosúlaďuje ich výstupy kontrastívnou, metrickou alebo predikčnou stratou. Geometria priestoru umožňuje cross-modal retrieval a zero-shot prenos. Kvalita závisí od párovania dát, negatívnych príkladov, normalizácie a významu použitej vzdialenosti.

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-J-18

Odborná definícia

Odborná definícia

Joint embedding je reprezentácia, v ktorej sa objekty z rôznych modalít, domén alebo pohľadov mapujú do zdieľaného vektorového priestoru tak, aby sémanticky súvisiace položky ležali blízko. Typickým príkladom sú páry obrázok a text, používateľ a položka alebo otázka a odpoveď. Enkodéry môžu byť odlišné, no tréningový cieľ zosúlaďuje ich výstupy kontrastívnou, metrickou alebo predikčnou stratou. Geometria priestoru umožňuje cross-modal retrieval a zero-shot prenos. Kvalita závisí od párovania dát, negatívnych príkladov, normalizácie a významu použitej vzdialenosti.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Obrázok psa a veta „hnedý pes beží po tráve“ majú úplne odlišnú surovú formu. Dva enkodéry ich však môžu previesť na vektory v tom istom priestore. Ak sa počas tréningu správne páry priťahujú a nesúvisiace od seba odtláčajú, textový dotaz neskôr nájde vhodný obrázok bez klasifikátora pre každú kategóriu. Vektorová blízkosť neznamená, že modalita obsahuje rovnaké detaily. Znamená iba, že tréningový cieľ ich považuje za zodpovedajúce podľa dostupných párov a negatívnych príkladov.

Časté otázky

Časté otázky

Musia mať enkodéry rovnakú architektúru?

Nie. Obraz môže spracovať vision transformer a text jazykový transformer. Dôležité je, aby projekčné hlavy vytvorili vektory kompatibilného rozmeru a tréning definoval spoločnú geometriu.

Ako sa joint embedding trénuje?

Často kontrastívnou stratou nad batchom párov. Správny obraz a text majú vysokú podobnosť, ostatné kombinácie slúžia ako negatíva. Alternatívou je triplet loss, klasifikačný cieľ alebo predikcia latentnej reprezentácie.

Čo je hubness v embeddingovom priestore?

Niektoré vektory sa stanú najbližšími susedmi neprimerane veľkého počtu dotazov, najmä vo vysokom rozmere. Zhoršuje to retrieval a môže súvisieť s anisotropiou, distribučným posunom alebo nevhodnou metrikou.

Dá sa priestor použiť na zero-shot klasifikáciu?

Áno. Vytvoria sa textové reprezentácie názvov alebo opisov tried a obraz sa priradí k najbližšej. Výkon závisí od promptu, tréningového pokrytia a toho, či podobnosť reprezentuje požadovanú taxonómiu.

Ako sa hodnotí kvalita?

Používa sa recall@k, median rank, zero-shot accuracy a analýza susedov. Dôležité je testovať obe smery vyhľadávania, rôzne podskupiny a odolnosť voči duplicitám alebo skratkovým koreláciám.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Radford a kol., CLIP

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.