Kvalita dat a robustní učení

Šum v cílových štítcích

Label noise označuje nesúlad mezi zaznamenaným cielovým štítkem a latentným nebo zamýšlaným cílem úlohy. Chyby mohou být náhodné, triedovo asymetrické nebo závislé od konkrétní vzorku, například když jsou hraniční případy častěji označené nesprávně. Zdrojem bývá nejednoznačné zadání, automatické slabé označování, chyba měření, změna taxonomie nebo rozdílně úsudky anotátorů. Hluboké sítě dokážu nesprávně labely memorovat, proto je třeba sledovat čistotu dat i robustnost tréninku.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-06

Odborná definice

Odborná definice

Label noise označuje nesúlad mezi zaznamenaným cielovým štítkem a latentným nebo zamýšlaným cílem úlohy. Chyby mohou být náhodné, triedovo asymetrické nebo závislé od konkrétní vzorku, například když jsou hraniční případy častěji označené nesprávně. Zdrojem bývá nejednoznačné zadání, automatické slabé označování, chyba měření, změna taxonomie nebo rozdílně úsudky anotátorů. Hluboké sítě dokážu nesprávně labely memorovat, proto je třeba sledovat čistotu dat i robustnost tréninku.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud je v tréninkové sade část faktúr označená jako podvod omylem, model dostává protichodné příklady. Při malém množstve šumu může najít správný vzor, ale při dlouhém tréninku si může zapametat i chyby. Důležité je zjistit, zda jsou omyly rovnomerné, nebo se sústreďují na určitý typ klienta, jazyk či třídu. Druhá situace je nebezpečnejšia, protože může systematicky posunout rozhodování. Řešení zahrnuje audit anotací, modelování nejistoty a robustní tréninková postupy.

Časté otázky

Časté otázky

Jaké hlavní typy label noise se rozlišují?

Symetrický šum mění labely přibližně nezávisle od třídy, asymetrický preferuje konkrétně zámeny a instance-dependent šum závisí na vlastností vzorku.

Jako lze podozrivé labely najít?

Pomáhá nesúlad mezi modely, vysoká ztráta, stabilní predikce opačnej třídy, kontrola sousedů v embeddingu a opetovná anotace vybraných případů.

Stačí vymazat všechny těžké příklady?

Ne. Ťažká vzorek může být vzácny, ale správný případ. Automatické čištění musí odlíšit informačne hodnotnou hranici tříd od skutečné chyby.

Proč se sleduje výkon podle tříd?

Při asymetrickom šume může celková accuracy vyzerat prijatelne, zatímco menšinová třída ztrácí recall nebo je systematicky prepisovaná.

Jak se má uchovat oprava labelu?

Jako verzovaná změna s původnou hodnotou, novým rozhodnutím, důvodom, anotátorom a datem. Tak lze spetne reprodukovat tréninkový korpus.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Song et al., Learning from Noisy Labels with Deep Neural Networks

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.