Odborná definice
Odborná definice
Contrastive learning je způsob učení reprezentací, při kterém se model učí približovat embeddingy pozitivních párů a oddělovat embeddingy negativních nebo nesúvisiacich příkladů. Pozitivní pár může vzniknout dvěma augmentacemi toho istého obrazu, zodpovedajúcim textem a obrázkom nebo dvěma pohladmi na tu jistou entitu. Výsledek závisí na definice párů, augmentací, batchu, teploty a kontrastívnej ztráty. Cílem není přímo predikovat třídu, ale vytvořit prostor, který lze použít na retrieval, clustering nebo fine-tuning.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Z jedné fotografie vytvoríte dva mírně odlišné pohlady, například orez a změnu jasu. Model se učí umiestnit jejich blízko sebe, protože zobrazují ten jistý objekt, a dále od jiných fotografií. Postupně přestane záviset od nepodstatných změn a zachytí užitočnejšie vlastnosti. Při textu může být pozitívnym párom otázka a správná odpověď. Pokud však augmentace odstraní význam nebo negativní příklad je v skutečnosti podobný, trénink dá modelu chybný signál. Návrh párů je proto jadrom metody.
Časté otázky
Časté otázky
Co je pozitivní pár?
Dvě reprezentace, které mají být v embeddingovom prostoru blízko. Mohou pochádzat z toho istého objektu po augmentaci, z překladu té určité věty nebo z obrázku a jeho popisu. Správná definice závisí na invariantnosti potrebnej v cílové úloze.
Na co slouží negativně příklady?
Vytvářejí tlak, aby se nesúvisiace reprezentace nezrútili do stejného bodu. Některé metody používají velký batch nebo memory bank, jiné se explicitným negatívom vyhýbají. Falešné negatíva mohou odďalovat semanticky příbuzné položky.
Proč je data augmentation kritická?
Určuje, které změny má reprezentace ignorovat. Při obraze může být rozumný crop a farba, ale otočení číslice 6 na 9 změní třídu. Augmentace musí zachovat význam cílové úlohy, jinak se model učí nesprávnu invariantnost.
Jak se kontrastívny model hodnotí?
Často lineárním probe na zmrazených embeddingoch, k-nearest neighbors, retrieval recallom nebo výkonem po fine-tuningu. Samotná tréninková ztráta nemusí predpovedat kvalitu aplikace. Test se provádí na datech bez leakage mezi pozitívnymi pármi.
Používá se contrastive learning i multimodální?
Ano. Model může približovat textový popis a zodpovedajúci obrázek a oddělovat nesprávně dvojice. Tak vznikne společný prostor pro textové vyhledávání obrázků nebo zero-shot klasifikaci. Kvalita párů a reprezentatívnost jazyků ovplyvnia výsledné schopnosti.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Chen a kol., A Simple Framework for Contrastive Learning of Visual Representations
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
