Odborná definice
Odborná definice
Joint embedding je reprezentace, ve které se objekty z různých modalit, domén nebo pohladů mapují do zdielaného vektorového prostoru tak, aby sémanticky související položky ležali blízko. Typickým příkladem jsou páry obrázek a text, uživatel a položka nebo otázka a odpověď. Enkodéry mohou být odlišné, ale tréninkový cíl zosúlaďuje jejich výstupy kontrastívnou, metrickou nebo predikčnou ztrátou. Geometrie prostoru umožňuje cross-modal retrieval a zero-shot přenos. Kvalita závisí na párování dat, negativních příkladů, normalizace a významu použitej vzdálenosti.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Obrázek psa a věta „hnedý pes beží po tráve“ mají zcela odlišnou surovou formu. Dva enkodéry jejich však mohou previesť na vektory v tom istom prostoru. Pokud se během tréninku správně páry priťahují a nesúvisiace od sebe odtláčají, textový dotaz později najde vhodný obrázek bez klasifikátora pro každou kategorii. Vektorová blízkost neznamená, že modalita obsahuje stejné detaily. Znamená pouze, že tréninkový cíl jejich považuje za zodpovedajúce podle dostupných párů a negativních příkladů.
Časté otázky
Časté otázky
Musí mít enkodéry stejnou architekturu?
Ne. Obraz může zpracovat vision transformer a text jazykový transformer. Důležité je, aby projekčné hlavy vytvořili vektory kompatibilného rozmeru a trénink definoval společnou geometrii.
Jak se joint embedding trénuje?
Často kontrastívnou ztrátou nad batchom párů. Správný obraz a text mají vysokou podobnost, ostatní kombinace slouží jako negatíva. Alternatívou je triplet loss, klasifikační cíl nebo predikce latentní reprezentace.
Co je hubness v embeddingovom prostoru?
Některé vektory se stanou najbližšími susedmi nepřiměřeně velkého počtu dotazů, zejména ve vysokém rozmere. Zhoršuje to retrieval a může souviset s anisotropiou, distribučným posunom nebo nevhodnou metrikou.
Lze prostor použít na zero-shot klasifikaci?
Ano. Vytvoří se textové reprezentace názvů nebo opisů tříd a obraz se přiřadí k najbližšej. Výkon závisí na promptu, tréninkového pokrytí a toho, či podobnost reprezentuje požadovanou taxonomii.
Jak se hodnotí kvalita?
Používá se recall@k, median rank, zero-shot accuracy a analýza sousedů. Důležité je testovat obě směry vyhledávání, různé podskupiny a odolnost vůči duplicitám nebo skratkovým koreláciám.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Radford a kol., CLIP
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
