Odborná definice
Odborná definice
Label noise označuje nesúlad mezi zaznamenaným cielovým štítkem a latentným nebo zamýšlaným cílem úlohy. Chyby mohou být náhodné, triedovo asymetrické nebo závislé od konkrétní vzorku, například když jsou hraniční případy častěji označené nesprávně. Zdrojem bývá nejednoznačné zadání, automatické slabé označování, chyba měření, změna taxonomie nebo rozdílně úsudky anotátorů. Hluboké sítě dokážu nesprávně labely memorovat, proto je třeba sledovat čistotu dat i robustnost tréninku.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Pokud je v tréninkové sade část faktúr označená jako podvod omylem, model dostává protichodné příklady. Při malém množstve šumu může najít správný vzor, ale při dlouhém tréninku si může zapametat i chyby. Důležité je zjistit, zda jsou omyly rovnomerné, nebo se sústreďují na určitý typ klienta, jazyk či třídu. Druhá situace je nebezpečnejšia, protože může systematicky posunout rozhodování. Řešení zahrnuje audit anotací, modelování nejistoty a robustní tréninková postupy.
Časté otázky
Časté otázky
Jaké hlavní typy label noise se rozlišují?
Symetrický šum mění labely přibližně nezávisle od třídy, asymetrický preferuje konkrétně zámeny a instance-dependent šum závisí na vlastností vzorku.
Jako lze podozrivé labely najít?
Pomáhá nesúlad mezi modely, vysoká ztráta, stabilní predikce opačnej třídy, kontrola sousedů v embeddingu a opetovná anotace vybraných případů.
Stačí vymazat všechny těžké příklady?
Ne. Ťažká vzorek může být vzácny, ale správný případ. Automatické čištění musí odlíšit informačne hodnotnou hranici tříd od skutečné chyby.
Proč se sleduje výkon podle tříd?
Při asymetrickom šume může celková accuracy vyzerat prijatelne, zatímco menšinová třída ztrácí recall nebo je systematicky prepisovaná.
Jak se má uchovat oprava labelu?
Jako verzovaná změna s původnou hodnotou, novým rozhodnutím, důvodom, anotátorom a datem. Tak lze spetne reprodukovat tréninkový korpus.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Song et al., Learning from Noisy Labels with Deep Neural Networks
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
