Odborná definice
Odborná definice
Self-supervised learning je učení, při kterém se cílový signál vytvoří automaticky ze samotných neanotovaných dat. Model může predpovedat skryté části textu, další token, chybějící úsek obrazu nebo shodu mezi dvěma transformovanými pohladmi na ten jistý příklad. Takto se naučí obecné reprezentace, které se později prispůsobia konkrétní úloze. Označení self-supervised neznamená, že data jsou bez lidského původu, bez výběru nebo bez skrytých predsudků. Úspěch se hodnotí prenosom na downstream úlohy, ne pouze ztrátou použitej predúlohy.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Místo toho, aby člověk označil milión obrázků, systém si vytvoří tréninkovou hádanku z obrázků, které už má. Jednu část zakryje a zkouší ji doplnit, nebo porovná dva upravené pohlady a učí se rozpoznat, že patří k tomu istému objektu. Při textu může skrývat slova nebo predpovedat pokračování. Výhodou je využití velkých neoznačených zbierok. Kvalita naučeného základu však závisí na složení dat a vhodnosti zvolené predúlohy. Dobrá predúloha núti model zachytit vlastnost, kterou bude později skutečná aplikace potrebovat.
Časté otázky
Časté otázky
Je self-supervised learning druh unsupervised learning?
Často se zařazuje do širšej rodiny učení bez ručných štítků, ale používá explicitní cíl odvodený z dat. Proto se od čisto distribučného nebo klastrovacieho učení prakticky odlišuje.
Jaké predúlohy se používají při textu?
Běžné jsou predikce dalšího tokenu, doplňání maskovaných tokenů, rekonštrukce poškodeného textu nebo kontrastivně rozlišování správných a nesprávnych párů.
Proč se model po pretrénování ještě dolaďuje?
Predtréning učí obecné vzory, ne přesný cíl aplikace. Fine-tuning, adaptér nebo lineární sonda upravia reprezentaci pro konkrétně třídy, styl či rozhodovací kritéria.
Může být cíl predúlohy nevhodný?
Ano. Model může excelovat v rekonštrukcii detailů, které nejsou důležité pro cílovou úlohu, nebo se naučit zkratky založené na artefaktoch dat.
Potřebuje self-supervised model anotace?
Predtréning jejich obvykle nepotřebuje, ale hodnocení a přizpůsobení často používají menší anotovaný soubor. Lidská práca zůstává i při výběru a čištění korpusu.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- BERT: Pre-training of Deep Bidirectional Transformers A Simple Framework for Contrastive Learning of Visual Representations
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
