Odborná definice
Odborná definice
Joint embedding architecture je systémové usporiadání dvou nebo více enkodérů, projekčných vrstev a tréninkového cíle, které vytváří kompatibilní reprezentace různých vstupů v společném latentním prostoru. Architektura určuje, zda se váhy zdielají, jak se reprezentace normalizují, kde se spojují modality a jaký mechanismus bráni kolapsu. Kontrastivně řešení používají pozitivně a negativně páry, prediktívne řešení mohou odhadovat cílový embedding bez rekonštrukce vstupu. Pojem označuje návrh systému, ne jednotlivý vektor vytvořený po inferenci.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Joint embedding je výsledný společný prostor. Joint embedding architecture je způsob, jak se tento prostor vybuduje. Návrh může mít samostatný obrazový a textový enkóder, normalizaci vektorů, teplotný parameter a kontrastívnu ztrátu. Jiná architektura může zakrýt část obrazu a predikovat její latentnou reprezentaci přes cílový enkóder. Rozdíly v zdielaní váh, projekčných hlavách a tréninkových pároch určují, jaké vztahy se v prostoru objeví. Proto dvě architektury s stejnou dimenzí embeddingu nemusí poskytovat zamenitelné vektory.
Časté otázky
Časté otázky
Čím se liší od modelu s early fusion?
Early fusion spojuje surová nebo nízkoúrovňové příznaky modalit ještě před spoločným spracováním. Joint embedding architecture může modality enkódovat odděleně a zosúladit až výsledné vektory, co umožňuje nezávislé indexování a retrieval.
Proč se používají projekčné hlavy?
Enkodér může vytvářet reprezentaci vhodnou pro více úloh, zatímco projekčná hlava ji mapuje do prostoru optimalizovaného konkrétnou ztrátou. Po tréninku se někdy používá výstup před projekcí, inokedy finálny embedding.
Jako architektura zabraňuje kolapsu?
Kontrastivně metody používají negatíva nebo normalizaci rozdělení. Prediktívne metody mohou mít stop-gradient, pomalu aktualizovaný cílový enkóder, varianci a kovariančné penalizace nebo asymetrii mezi vetvami.
Kdy se zdielají váhy enkodérů?
Při dvou augmentovaných pohladoch stejné modality bývá sdílení prirodzené. Při textu a obraze jsou vstupy odlišné, proto mají enkodéry obvykle jinou architekturu, ačkoli projekce směřují do společné dimenze.
Co je třeba uložit pro produkční použití?
Verzi každého enkodéra, projekčných vrstev, tokenizéra nebo předzpracování, normalizaci a metriku podobnosti. Změna jedinej větve může znekompatibilnit nové embeddingy s už uloženým indexem.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- LeCun, A Path Towards Autonomous Machine Intelligence Assran a kol., I-JEPA
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
