Tréning s kombinovanými dátami

Semi-supervised learning

polo-riadené učenie

Semi-supervised learning je učenie z malej množiny označených príkladov a väčšej množiny neoznačených dát. Algoritmus využíva štruktúru neoznačeného rozdelenia pomocou pseudoštítkov, konzistenčnej regularizácie, grafového šírenia alebo generatívneho modelovania. Prínos závisí od predpokladu, že neoznačené dáta pochádzajú z relevantného prostredia a ich štruktúra súvisí s cieľovými triedami. Nesprávne pseudoštítky sa môžu zosilňovať a zhoršiť model. Pomer označených a neoznačených príkladov sa uvádza spolu s pravidlom ich miešania v dávkach.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-10

Odborná definícia

Odborná definícia

Semi-supervised learning je učenie z malej množiny označených príkladov a väčšej množiny neoznačených dát. Algoritmus využíva štruktúru neoznačeného rozdelenia pomocou pseudoštítkov, konzistenčnej regularizácie, grafového šírenia alebo generatívneho modelovania. Prínos závisí od predpokladu, že neoznačené dáta pochádzajú z relevantného prostredia a ich štruktúra súvisí s cieľovými triedami. Nesprávne pseudoštítky sa môžu zosilňovať a zhoršiť model. Pomer označených a neoznačených príkladov sa uvádza spolu s pravidlom ich miešania v dávkach.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Predstavte si 1 000 fotografií, ale iba 80 z nich má overený názov objektu. Model sa najprv učí z označených fotografií a potom využije aj zvyšok. Môže priradiť sebavedomé dočasné štítky alebo vyžadovať, aby rôzne úpravy tej istej fotografie viedli k podobnej predikcii. Takto získa viac signálu bez úplnej anotácie. Ak však neoznačená zbierka obsahuje iné objekty alebo prvé predikcie sú zaujaté, chyby sa môžu rozmnožiť. Kontrolný experiment má ukázať, či zisk pochádza z ďalších dát, a nie iba z odlišnej augmentácie.

Časté otázky

Časté otázky

Ako sa semi-supervised learning líši od self-supervised learning?

Semi-supervised režim priamo kombinuje skutočné štítky s neoznačenými dátami pre cieľovú úlohu. Self-supervised predtréning vytvára pomocný cieľ automaticky zo samotných dát.

Čo je pseudo-labeling?

Model priradí neoznačenému príkladu predikovanú triedu a dostatočne sebavedomé predikcie použije ako dočasné tréningové štítky. Prah a kalibrácia výrazne ovplyvňujú chyby.

Čo robí consistency regularization?

Požaduje, aby model dával podobnú predikciu pre rôzne prípustné transformácie toho istého príkladu, napríklad mierne upravený obraz alebo zašumený vstup.

Kedy neoznačené dáta nepomôžu?

Keď pochádzajú z odlišnej distribúcie, obsahujú neznáme triedy alebo ich dominantné vzory nesúvisia s cieľom. Vtedy môžu posunúť rozhodovaciu hranicu nesprávnym smerom.

Ako sa hodnotí prínos neoznačených dát?

Porovná sa model trénovaný iba na označených dátach s polo-riadenou verziou pri rovnakom testovacom súbore. Sleduje sa aj výkon menšinových tried a citlivosť na prah pseudoštítkov.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • MixMatch: A Holistic Approach to Semi-Supervised Learning
  • scikit-learn Semi-supervised learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.