Kvalita dát a robustné učenie

Label noise

Šum v cieľových štítkoch

Label noise označuje nesúlad medzi zaznamenaným cieľovým štítkom a latentným alebo zamýšľaným cieľom úlohy. Chyby môžu byť náhodné, triedovo asymetrické alebo závislé od konkrétnej vzorky, napríklad keď sú hraničné prípady častejšie označené nesprávne. Zdrojom býva nejednoznačné zadanie, automatické slabé označovanie, chyba merania, zmena taxonómie alebo rozdielne úsudky anotátorov. Hlboké siete dokážu nesprávne labely memorovať, preto treba sledovať čistotu dát aj robustnosť tréningu.

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-06

Odborná definícia

Odborná definícia

Label noise označuje nesúlad medzi zaznamenaným cieľovým štítkom a latentným alebo zamýšľaným cieľom úlohy. Chyby môžu byť náhodné, triedovo asymetrické alebo závislé od konkrétnej vzorky, napríklad keď sú hraničné prípady častejšie označené nesprávne. Zdrojom býva nejednoznačné zadanie, automatické slabé označovanie, chyba merania, zmena taxonómie alebo rozdielne úsudky anotátorov. Hlboké siete dokážu nesprávne labely memorovať, preto treba sledovať čistotu dát aj robustnosť tréningu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Ak je v tréningovej sade časť faktúr označená ako podvod omylom, model dostáva protichodné príklady. Pri malom množstve šumu môže nájsť správny vzor, no pri dlhom tréningu si môže zapamätať aj chyby. Dôležité je zistiť, či sú omyly rovnomerné, alebo sa sústreďujú na určitý typ klienta, jazyk či triedu. Druhá situácia je nebezpečnejšia, pretože môže systematicky posunúť rozhodovanie. Riešenie zahŕňa audit anotácií, modelovanie neistoty a robustné tréningové postupy.

Časté otázky

Časté otázky

Aké hlavné typy label noise sa rozlišujú?

Symetrický šum mení labely približne nezávisle od triedy, asymetrický preferuje konkrétne zámeny a instance-dependent šum závisí od vlastností vzorky.

Ako možno podozrivé labely nájsť?

Pomáha nesúlad medzi modelmi, vysoká strata, stabilná predikcia opačnej triedy, kontrola susedov v embeddingu a opätovná anotácia vybraných prípadov.

Stačí vymazať všetky ťažké príklady?

Nie. Ťažká vzorka môže byť vzácny, ale správny prípad. Automatické čistenie musí odlíšiť informačne hodnotnú hranicu tried od skutočnej chyby.

Prečo sa sleduje výkon podľa tried?

Pri asymetrickom šume môže celková accuracy vyzerať prijateľne, zatiaľ čo menšinová trieda stráca recall alebo je systematicky prepisovaná.

Ako sa má uchovať oprava labelu?

Ako verzovaná zmena s pôvodnou hodnotou, novým rozhodnutím, dôvodom, anotátorom a dátumom. Tak možno spätne reprodukovať tréningový korpus.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Song et al., Learning from Noisy Labels with Deep Neural Networks

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.