Kvalita dat a robustní učení

Učení s chybnými anotacemi

Noisy label learning zkoumá trénink modelů v situaci, když část cílových označení je nesprávná, nejednoznačná nebo nekonzistentná. Šum může být náhodný, závislý od skutečné třídy, vstupu, anotátora nebo zberového procesu. Metody využívají robustní ztráty, odhad prechodovej matice, výběr malých strát, co-teaching, korekci labelů nebo semi-supervised učení. Klíčové je rozlíšit chybné označení od ťažkého, ale legitímneho příkladu, jinak čištění odstraní důležitou hranici rozhodování.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-N-17

Odborná definice

Odborná definice

Noisy label learning zkoumá trénink modelů v situaci, když část cílových označení je nesprávná, nejednoznačná nebo nekonzistentná. Šum může být náhodný, závislý od skutečné třídy, vstupu, anotátora nebo zberového procesu. Metody využívají robustní ztráty, odhad prechodovej matice, výběr malých strát, co-teaching, korekci labelů nebo semi-supervised učení. Klíčové je rozlíšit chybné označení od ťažkého, ale legitímneho příkladu, jinak čištění odstraní důležitou hranici rozhodování.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud fotografie označuje dav pracovníků, některé mačky budú omylem označené jako psy. Velká síť si může nejprve osvojit obecný vzor a později si zapametat i chybné labely. Noisy label learning se snaží tento proces spomalit nebo odhalit podozrivé příklady. Nestačí automaticky vyhodit vše, při čem model nesúhlasí s anotací, protože právě neobvyklé případy mohou být najhodnotnejšie. Podozrivé záznamy mají směřovat na cielenou revízi a oprava musí zůstat auditovatelná.

Časté otázky

Časté otázky

Jaké mechanizmy chybnej anotace se rozlišují?

Při symetrickom šume se cíl zamení náhodně, class-dependent chyba se váže na skutečnou třídu a instance-dependent i na konkrétní vstup. Posledný typ je najťažší, lebo kopíruje nejednoznačnost dat.

Proč hluboké sítě dokážu memorovat chybné labely?

Mají vysokou kapacitu a při dlouhém tréninku mohou snížit ztrátu i na nekonzistentných příkladech. Skorá fáza učení často zachytí jednodušší pravidelnosti dříve než individuálny šum.

Co je co-teaching?

Dva modely se trénují současně a každý vybírá příklady s malou ztrátou pro druhý model. Cílem je omezit samo-potvrdzování chyb, ale oba modely se mohou postupně zhodnúť na stejných omyloch.

Jak se ověřuje, či label je skutečně nesprávný?

Nejlépe opakovanou anotací, odborným posúdením a kontrolou zdrojového důkazu. Nízká modelová istota nebo vysoká ztráta je pouze signál na revízi, ne automatický verdikt.

Může label smoothing vyriešit chybnou anotaci?

Může snížit prehnanou istotu a částečně zmiernit důsledky šumu, ale neopraví systematicky nesprávně třídy ani zaujatý proces anotace. Potřebná je datová diagnostika.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Learning from Noisy Labels with Deep Neural Networks: A Survey

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.