Kvalita dát a robustné učenie

Noisy label learning

Učenie s chybnými anotáciami

Noisy label learning skúma tréning modelov v situácii, keď časť cieľových označení je nesprávna, nejednoznačná alebo nekonzistentná. Šum môže byť náhodný, závislý od skutočnej triedy, vstupu, anotátora alebo zberového procesu. Metódy využívajú robustné straty, odhad prechodovej matice, výber malých strát, co-teaching, korekciu labelov alebo semi-supervised učenie. Kľúčové je rozlíšiť chybné označenie od ťažkého, ale legitímneho príkladu, inak čistenie odstráni dôležitú hranicu rozhodovania.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-N-17

Odborná definícia

Odborná definícia

Noisy label learning skúma tréning modelov v situácii, keď časť cieľových označení je nesprávna, nejednoznačná alebo nekonzistentná. Šum môže byť náhodný, závislý od skutočnej triedy, vstupu, anotátora alebo zberového procesu. Metódy využívajú robustné straty, odhad prechodovej matice, výber malých strát, co-teaching, korekciu labelov alebo semi-supervised učenie. Kľúčové je rozlíšiť chybné označenie od ťažkého, ale legitímneho príkladu, inak čistenie odstráni dôležitú hranicu rozhodovania.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Ak fotografie označuje dav pracovníkov, niektoré mačky budú omylom označené ako psy. Veľká sieť si môže najprv osvojiť všeobecný vzor a neskôr si zapamätať aj chybné labely. Noisy label learning sa snaží tento proces spomaliť alebo odhaliť podozrivé príklady. Nestačí automaticky vyhodiť všetko, pri čom model nesúhlasí s anotáciou, pretože práve neobvyklé prípady môžu byť najhodnotnejšie. Podozrivé záznamy majú smerovať na cielenú revíziu a oprava musí zostať auditovateľná.

Časté otázky

Časté otázky

Aké mechanizmy chybnej anotácie sa rozlišujú?

Pri symetrickom šume sa cieľ zamení náhodne, class-dependent chyba sa viaže na skutočnú triedu a instance-dependent aj na konkrétny vstup. Posledný typ je najťažší, lebo kopíruje nejednoznačnosť dát.

Prečo hlboké siete dokážu memorovať chybné labely?

Majú vysokú kapacitu a pri dlhom tréningu môžu znížiť stratu aj na nekonzistentných príkladoch. Skorá fáza učenia často zachytí jednoduchšie pravidelnosti skôr než individuálny šum.

Čo je co-teaching?

Dva modely sa trénujú súčasne a každý vyberá príklady s malou stratou pre druhý model. Cieľom je obmedziť samo-potvrdzovanie chýb, no oba modely sa môžu postupne zhodnúť na rovnakých omyloch.

Ako sa overuje, či label je skutočne nesprávny?

Najlepšie opakovanou anotáciou, odborným posúdením a kontrolou zdrojového dôkazu. Nízka modelová istota alebo vysoká strata je iba signál na revíziu, nie automatický verdikt.

Môže label smoothing vyriešiť chybnú anotáciu?

Môže znížiť prehnanú istotu a čiastočne zmierniť dôsledky šumu, ale neopraví systematicky nesprávne triedy ani zaujatý proces anotácie. Potrebná je dátová diagnostika.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Learning from Noisy Labels with Deep Neural Networks: A Survey

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.