Trénovanie a optimalizácia · Tréning a reprezentácie

Samoučenie bez ručných anotácií

Self-supervised learning

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-07

Odborná definícia

Význam a odborné vymedzenie pojmu

Self-supervised learning je učenie, pri ktorom sa cieľový signál vytvorí automaticky zo samotných neanotovaných dát. Model môže predpovedať skryté časti textu, ďalší token, chýbajúci úsek obrazu alebo zhodu medzi dvoma transformovanými pohľadmi na ten istý príklad. Takto sa naučí všeobecné reprezentácie, ktoré sa neskôr prispôsobia konkrétnej úlohe. Označenie self-supervised neznamená, že dáta sú bez ľudského pôvodu, bez výberu alebo bez skrytých predsudkov. Úspech sa hodnotí prenosom na downstream úlohy, nie iba stratou použitej predúlohy.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Namiesto toho, aby človek označil milión obrázkov, systém si vytvorí tréningovú hádanku z obrázkov, ktoré už má. Jednu časť zakryje a skúša ju doplniť, alebo porovná dva upravené pohľady a učí sa rozpoznať, že patria k tomu istému objektu. Pri texte môže skrývať slová alebo predpovedať pokračovanie. Výhodou je využitie veľkých neoznačených zbierok. Kvalita naučeného základu však závisí od zloženia dát a vhodnosti zvolenej predúlohy. Dobrá predúloha núti model zachytiť vlastnosť, ktorú bude neskôr skutočná aplikácia potrebovať.

Časté otázky

Otázky, ktoré spresňujú význam

Je self-supervised learning druh unsupervised learning?

Často sa zaraďuje do širšej rodiny učenia bez ručných štítkov, no používa explicitný cieľ odvodený z dát. Preto sa od čisto distribučného alebo klastrovacieho učenia prakticky odlišuje.

Aké predúlohy sa používajú pri texte?

Bežné sú predikcia ďalšieho tokenu, dopĺňanie maskovaných tokenov, rekonštrukcia poškodeného textu alebo kontrastívne rozlišovanie správnych a nesprávnych párov.

Prečo sa model po pretrénovaní ešte dolaďuje?

Predtréning učí všeobecné vzory, nie presný cieľ aplikácie. Fine-tuning, adaptér alebo lineárna sonda upravia reprezentáciu pre konkrétne triedy, štýl či rozhodovacie kritériá.

Môže byť cieľ predúlohy nevhodný?

Áno. Model môže excelovať v rekonštrukcii detailov, ktoré nie sú dôležité pre cieľovú úlohu, alebo sa naučiť skratky založené na artefaktoch dát.

Potrebuje self-supervised model anotácie?

Predtréning ich zvyčajne nepotrebuje, ale hodnotenie a prispôsobenie často používajú menší anotovaný súbor. Ľudská práca zostáva aj pri výbere a čistení korpusu.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • BERT: Pre-training of Deep Bidirectional Transformers A Simple Framework for Contrastive Learning of Visual Representations

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.