Odborná definice
Odborná definice
Semi-supervised learning je učení z malé množiny označených příkladů a večšej množiny neoznačených dat. Algoritmus využívá strukturu neoznačeného rozdělení pomocí pseudoštítků, konzistenčnej regularizace, grafového šíření nebo generativního modelování. Přínos závisí na predpokladu, že neoznačené data pochádzají z relevantného prostředí a jejich struktura souvisí s cielovými třídami. Nesprávně pseudoštítky se mohou zosilňovat a zhoršit model. Poměr označených a neoznačených příkladů se uvádí spolu s pravidlem jejich miešání v dávkách.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Představte si 1 000 fotografií, ale pouze 80 z nich má ověřený název objektu. Model se nejprve učí z označených fotografií a potom využije i zbytek. Může přiřadit sebavedomé dočasné štítky nebo vyžadovat, aby různé úpravy té určité fotografie viedli k podobné predikci. Takto získá více signálu bez úplnej anotace. Pokud však neoznačená zbierka obsahuje jiné objekty nebo první predikce jsou zaujaté, chyby se mohou rozmnožit. Kontrolní experiment má ukázat, či zisk pochází z dalších dat, a ne pouze z odlišnej augmentace.
Časté otázky
Časté otázky
Jak se semi-supervised learning liší od self-supervised learning?
Semi-supervised režim přímo kombinuje skutečné štítky s neoznačenými daty pro cílovou úlohu. Self-supervised predtréning vytváří pomocný cíl automaticky ze samotných dat.
Co je pseudo-labeling?
Model přiřadí neoznačenému příkladu predikovanou třídu a dostatečně sebavedomé predikce použije jako dočasné tréninková štítky. Práh a kalibrace výrazně ovlivňují chyby.
Co dělá consistency regularization?
Požaduje, aby model dával podobnou predikci pro různé prípustné transformace toho istého příkladu, například mírně upravený obraz nebo zašumený vstup.
Kdy neoznačené data nepomůžu?
Když pochádzají z odlišnej distribuce, obsahují neznámé třídy nebo jejich dominantné vzory nesúvise s cílem. Tehdy mohou posunout rozhodovací hranici nesprávnym směrem.
Jak se hodnotí přínos neoznačených dat?
Porovná se model trénovaný pouze na označených datech s částečně-riadenou verzí při stejném testovacom souboru. Sleduje se i výkon menšinových tříd a citlivost na práh pseudoštítků.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- MixMatch: A Holistic Approach to Semi-Supervised Learning
- scikit-learn Semi-supervised learning
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
