Trénovanie a optimalizácia · Dátovo orientované strojové učenie

Slabý dohľad pri tvorbe tréningových štítkov

Weak supervision

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-05

Odborná definícia

Význam a odborné vymedzenie pojmu

Weak supervision je spôsob tvorby tréningových štítkov z lacnejších, nepresných alebo čiastočných zdrojov namiesto individuálneho ručného označenia každého príkladu. Zdrojom môžu byť pravidlá, databázové väzby, heuristiky, existujúce modely, vzdialený dohľad alebo ľudské označenia s rôznou spoľahlivosťou. Programatické prístupy modelujú presnosť a závislosti labelovacích funkcií a vytvárajú pravdepodobnostné štítky. Metóda zrýchľuje pokrytie dát, no chyby zdrojov, korelované pravidlá a systematické slepé miesta sa môžu preniesť do výsledného modelu.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Namiesto toho, aby odborník ručne prečítal stotisíc dokumentov, zapíše niekoľko pravidiel. Jedno označí reklamáciu podľa slovného spojenia, druhé využije typ formulára a tretie hlas staršieho klasifikátora. Každé pravidlo robí chyby a niektoré sa navzájom kopírujú. Weak supervision sa pokúsi odhadnúť, ktorým zdrojom dôverovať a ako ich konflikty spojiť do tréningových cieľov. Výhodou je rýchle škálovanie, nevýhodou riziko, že súbor pravidiel nikdy nezachytí prípady mimo predstavy jeho autorov.

Časté otázky

Otázky, ktoré spresňujú význam

Čo je labelovacia funkcia?

Je to programové pravidlo, ktoré pre príklad vráti triedu, abstenciu alebo inú formu slabého signálu. Jej kvalita sa hodnotí podľa pokrytia, konfliktov a odhadovanej presnosti.

Ako sa slabé zdroje kombinujú?

Label model môže odhadnúť ich spoľahlivosť a závislosti bez potreby veľkej gold množiny. Výstupom sú často pravdepodobnostné štítky pre diskriminačný model.

Prečo nestačí jednoduché väčšinové hlasovanie?

Predpokladá rovnakú kvalitu a nezávislosť zdrojov. Dve takmer totožné pravidlá môžu prehlasovať presnejší, ale osamelý zdroj.

Potrebuje weak supervision ručne označené dáta?

Na vytvorenie signálu nie vždy, ale malá kurátorovaná množina je veľmi užitočná na vývoj pravidiel, odhad chýb, kalibráciu a finálne hodnotenie.

Aké riziko vzniká pri použití LLM ako labelera?

Model môže produkovať konzistentné, no systematicky skreslené štítky, citlivo reagovať na prompt a kopírovať chyby z rovnakého zdroja, z ktorého sa učí cieľový model.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Snorkel: Rapid Training Data Creation with Weak Supervision Snorkel AI, Essential Guide to Weak Supervision

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.