Dátovo orientované strojové učení

slabý dohled při tvorbě tréninkových štítků

Weak supervision je způsob tvorby tréninkových štítků z lacnejších, nepresných nebo čiastočných zdrojů místo individuálneho ručného označení každého příkladu. Zdrojem mohou být pravidla, databázové vezby, heuristiky, existujúce modely, vzdálený dohled nebo lidské označení s různou spolahlivosťou. Programatické přístupy modelují přesnost a závislosti labelovacích funkcí a vytvářejí pravděpodobnostní štítky. Metoda zrýchluje pokrytí dat, ale chyby zdrojů, korelované pravidla a systematické slepé místa se mohou přenést do výsledného modelu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-05

Odborná definice

Odborná definice

Weak supervision je způsob tvorby tréninkových štítků z lacnejších, nepresných nebo čiastočných zdrojů místo individuálneho ručného označení každého příkladu. Zdrojem mohou být pravidla, databázové vezby, heuristiky, existujúce modely, vzdálený dohled nebo lidské označení s různou spolahlivosťou. Programatické přístupy modelují přesnost a závislosti labelovacích funkcí a vytvářejí pravděpodobnostní štítky. Metoda zrýchluje pokrytí dat, ale chyby zdrojů, korelované pravidla a systematické slepé místa se mohou přenést do výsledného modelu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Místo toho, aby odborník ručně prečítal stotisíc dokumentů, zapíše několik pravidel. Jedno označí reklamaci podle slovného spojení, druhé využije typ formulára a třetí hlas staršieho klasifikátora. Každé pravidlo dělá chyby a některé se navzájem kopírují. Weak supervision se pokúsi odhadnout, kterým zdrojem důvěřovat a jako jejich konflikty spojit do tréninkových cílů. Výhodou je rychle škálování, nevýhodou riziko, že soubor pravidel nikdy nezachytí případy mimo predstavy jeho autorů.

Časté otázky

Časté otázky

Co je labelovace funkce?

Je to programové pravidlo, které pro příklad vrátí třídu, abstenci nebo jinou formu slabého signálu. Její kvalita se hodnotí podle pokrytí, konfliktů a odhadovanej přesnosti.

Jak se slabé zdroje kombinují?

Label model může odhadnout jejich spolehlivost a závislosti bez potřeby velké gold množiny. Výstupem jsou často pravděpodobnostní štítky pro diskriminační model.

Proč nestačí jednoduché večšinové hlasování?

Předpokládá stejnou kvalitu a nezávislost zdrojů. Dvě téměř totožné pravidla mohou prehlasovat přesnější, ale osamelý zdroj.

Potřebuje weak supervision ručně označené data?

Na vytvoření signálu ne vždy, ale malá kurátorovaná množina je velmi užitečná na vývoj pravidel, odhad chyb, kalibraci a finálne hodnocení.

Jaké riziko vzniká při použití LLM jako labelera?

Model může produkovat konzistentní, ale systematicky skreslené štítky, citlivo reagovat na prompt a kopírovat chyby z stejného zdroje, ze kterého se učí cílový model.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Snorkel: Rapid Training Data Creation with Weak Supervision Snorkel AI, Essential Guide to Weak Supervision

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.