Trénink a reprezentace

samoučení bez ručných anotací

Self-supervised learning je učení, při kterém se cílový signál vytvoří automaticky ze samotných neanotovaných dat. Model může predpovedat skryté části textu, další token, chybějící úsek obrazu nebo shodu mezi dvěma transformovanými pohladmi na ten jistý příklad. Takto se naučí obecné reprezentace, které se později prispůsobia konkrétní úloze. Označení self-supervised neznamená, že data jsou bez lidského původu, bez výběru nebo bez skrytých predsudků. Úspěch se hodnotí prenosom na downstream úlohy, ne pouze ztrátou použitej predúlohy.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-07

Odborná definice

Odborná definice

Self-supervised learning je učení, při kterém se cílový signál vytvoří automaticky ze samotných neanotovaných dat. Model může predpovedat skryté části textu, další token, chybějící úsek obrazu nebo shodu mezi dvěma transformovanými pohladmi na ten jistý příklad. Takto se naučí obecné reprezentace, které se později prispůsobia konkrétní úloze. Označení self-supervised neznamená, že data jsou bez lidského původu, bez výběru nebo bez skrytých predsudků. Úspěch se hodnotí prenosom na downstream úlohy, ne pouze ztrátou použitej predúlohy.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Místo toho, aby člověk označil milión obrázků, systém si vytvoří tréninkovou hádanku z obrázků, které už má. Jednu část zakryje a zkouší ji doplnit, nebo porovná dva upravené pohlady a učí se rozpoznat, že patří k tomu istému objektu. Při textu může skrývat slova nebo predpovedat pokračování. Výhodou je využití velkých neoznačených zbierok. Kvalita naučeného základu však závisí na složení dat a vhodnosti zvolené predúlohy. Dobrá predúloha núti model zachytit vlastnost, kterou bude později skutečná aplikace potrebovat.

Časté otázky

Časté otázky

Je self-supervised learning druh unsupervised learning?

Často se zařazuje do širšej rodiny učení bez ručných štítků, ale používá explicitní cíl odvodený z dat. Proto se od čisto distribučného nebo klastrovacieho učení prakticky odlišuje.

Jaké predúlohy se používají při textu?

Běžné jsou predikce dalšího tokenu, doplňání maskovaných tokenů, rekonštrukce poškodeného textu nebo kontrastivně rozlišování správných a nesprávnych párů.

Proč se model po pretrénování ještě dolaďuje?

Predtréning učí obecné vzory, ne přesný cíl aplikace. Fine-tuning, adaptér nebo lineární sonda upravia reprezentaci pro konkrétně třídy, styl či rozhodovací kritéria.

Může být cíl predúlohy nevhodný?

Ano. Model může excelovat v rekonštrukcii detailů, které nejsou důležité pro cílovou úlohu, nebo se naučit zkratky založené na artefaktoch dat.

Potřebuje self-supervised model anotace?

Predtréning jejich obvykle nepotřebuje, ale hodnocení a přizpůsobení často používají menší anotovaný soubor. Lidská práca zůstává i při výběru a čištění korpusu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • BERT: Pre-training of Deep Bidirectional Transformers A Simple Framework for Contrastive Learning of Visual Representations

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.