Odborná definícia
Odborná definícia
Label noise označuje nesúlad medzi zaznamenaným cieľovým štítkom a latentným alebo zamýšľaným cieľom úlohy. Chyby môžu byť náhodné, triedovo asymetrické alebo závislé od konkrétnej vzorky, napríklad keď sú hraničné prípady častejšie označené nesprávne. Zdrojom býva nejednoznačné zadanie, automatické slabé označovanie, chyba merania, zmena taxonómie alebo rozdielne úsudky anotátorov. Hlboké siete dokážu nesprávne labely memorovať, preto treba sledovať čistotu dát aj robustnosť tréningu.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Ak je v tréningovej sade časť faktúr označená ako podvod omylom, model dostáva protichodné príklady. Pri malom množstve šumu môže nájsť správny vzor, no pri dlhom tréningu si môže zapamätať aj chyby. Dôležité je zistiť, či sú omyly rovnomerné, alebo sa sústreďujú na určitý typ klienta, jazyk či triedu. Druhá situácia je nebezpečnejšia, pretože môže systematicky posunúť rozhodovanie. Riešenie zahŕňa audit anotácií, modelovanie neistoty a robustné tréningové postupy.
Časté otázky
Časté otázky
Aké hlavné typy label noise sa rozlišujú?
Symetrický šum mení labely približne nezávisle od triedy, asymetrický preferuje konkrétne zámeny a instance-dependent šum závisí od vlastností vzorky.
Ako možno podozrivé labely nájsť?
Pomáha nesúlad medzi modelmi, vysoká strata, stabilná predikcia opačnej triedy, kontrola susedov v embeddingu a opätovná anotácia vybraných prípadov.
Stačí vymazať všetky ťažké príklady?
Nie. Ťažká vzorka môže byť vzácny, ale správny prípad. Automatické čistenie musí odlíšiť informačne hodnotnú hranicu tried od skutočnej chyby.
Prečo sa sleduje výkon podľa tried?
Pri asymetrickom šume môže celková accuracy vyzerať prijateľne, zatiaľ čo menšinová trieda stráca recall alebo je systematicky prepisovaná.
Ako sa má uchovať oprava labelu?
Ako verzovaná zmena s pôvodnou hodnotou, novým rozhodnutím, dôvodom, anotátorom a dátumom. Tak možno spätne reprodukovať tréningový korpus.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Song et al., Learning from Noisy Labels with Deep Neural Networks
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
