Trénink s kombinovanými daty

částečně-řízené učení

Semi-supervised learning je učení z malé množiny označených příkladů a večšej množiny neoznačených dat. Algoritmus využívá strukturu neoznačeného rozdělení pomocí pseudoštítků, konzistenčnej regularizace, grafového šíření nebo generativního modelování. Přínos závisí na predpokladu, že neoznačené data pochádzají z relevantného prostředí a jejich struktura souvisí s cielovými třídami. Nesprávně pseudoštítky se mohou zosilňovat a zhoršit model. Poměr označených a neoznačených příkladů se uvádí spolu s pravidlem jejich miešání v dávkách.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-10

Odborná definice

Odborná definice

Semi-supervised learning je učení z malé množiny označených příkladů a večšej množiny neoznačených dat. Algoritmus využívá strukturu neoznačeného rozdělení pomocí pseudoštítků, konzistenčnej regularizace, grafového šíření nebo generativního modelování. Přínos závisí na predpokladu, že neoznačené data pochádzají z relevantného prostředí a jejich struktura souvisí s cielovými třídami. Nesprávně pseudoštítky se mohou zosilňovat a zhoršit model. Poměr označených a neoznačených příkladů se uvádí spolu s pravidlem jejich miešání v dávkách.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si 1 000 fotografií, ale pouze 80 z nich má ověřený název objektu. Model se nejprve učí z označených fotografií a potom využije i zbytek. Může přiřadit sebavedomé dočasné štítky nebo vyžadovat, aby různé úpravy té určité fotografie viedli k podobné predikci. Takto získá více signálu bez úplnej anotace. Pokud však neoznačená zbierka obsahuje jiné objekty nebo první predikce jsou zaujaté, chyby se mohou rozmnožit. Kontrolní experiment má ukázat, či zisk pochází z dalších dat, a ne pouze z odlišnej augmentace.

Časté otázky

Časté otázky

Jak se semi-supervised learning liší od self-supervised learning?

Semi-supervised režim přímo kombinuje skutečné štítky s neoznačenými daty pro cílovou úlohu. Self-supervised predtréning vytváří pomocný cíl automaticky ze samotných dat.

Co je pseudo-labeling?

Model přiřadí neoznačenému příkladu predikovanou třídu a dostatečně sebavedomé predikce použije jako dočasné tréninková štítky. Práh a kalibrace výrazně ovlivňují chyby.

Co dělá consistency regularization?

Požaduje, aby model dával podobnou predikci pro různé prípustné transformace toho istého příkladu, například mírně upravený obraz nebo zašumený vstup.

Kdy neoznačené data nepomůžu?

Když pochádzají z odlišnej distribuce, obsahují neznámé třídy nebo jejich dominantné vzory nesúvise s cílem. Tehdy mohou posunout rozhodovací hranici nesprávnym směrem.

Jak se hodnotí přínos neoznačených dat?

Porovná se model trénovaný pouze na označených datech s částečně-riadenou verzí při stejném testovacom souboru. Sleduje se i výkon menšinových tříd a citlivost na práh pseudoštítků.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • MixMatch: A Holistic Approach to Semi-Supervised Learning
  • scikit-learn Semi-supervised learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.