Data a klasifikační modely

Nevyváženost tříd

Class imbalance je stav, když mají cílové třídy výrazně rozdílně zastoupení nebo když je málo příkladů třídy s najvyšším rozhodovacím významom. Model optimalizovaný na průměrnou ztrátu může preferovat večšinovou třídu a dosáhnout vysokou accuracy při slabom zachytení vzácných případů. Řešení zahrnují vážení ztráty, resampling, generování dat, threshold tuning, vhodné metriky a sběr nových příkladů. Nerovnováha sama neurčuje problém, rozhodují i náklady chyb, separovatelnost a kvalita označení.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-11

Odborná definice

Odborná definice

Class imbalance je stav, když mají cílové třídy výrazně rozdílně zastoupení nebo když je málo příkladů třídy s najvyšším rozhodovacím významom. Model optimalizovaný na průměrnou ztrátu může preferovat večšinovou třídu a dosáhnout vysokou accuracy při slabom zachytení vzácných případů. Řešení zahrnují vážení ztráty, resampling, generování dat, threshold tuning, vhodné metriky a sběr nových příkladů. Nerovnováha sama neurčuje problém, rozhodují i náklady chyb, separovatelnost a kvalita označení.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud je pouze jedna ze sto transakcií podvodná, model, který vždy řekne bez podvodu, dosáhne 99 procent accuracy a přitom je zcela nepoužitelný. Cílem není mechanicky vyrovnat počty na polovicu, ale naučit systém zachytit rizikovou třídu při prijatelnom množstve falešných poplachů. Při tréninku lze podvody zvýraznit váhou nebo samplingom, při nasazení se práh nastaví podle nákladů a kapacity vyšetrovatelů. Testovací sada má zachovat realistickou prevalenci, jinak se provozní metriky skreslia.

Časté otázky

Časté otázky

Proč accuracy při nevyvážených třídách zavádí?

Je dominovaná večšinovou třídou a neukáže, či model zachytil zriedkavý, ale důležitý jev. Vhodnější jsou precision, recall, PR AUC, confusion matrix a nákladovo vážené metriky. Výběr závisí na následků false positive a false negative.

Co dělá class weighting?

Chybám na vybranej třídě přiřadí větší váhu v ztrátové funkcii. Optimalizátor potom venuje více pozornosti příkladem, které by jinak prekryla večšina. Příliš vysoká váha může zvýšit falešné poplachy nebo destabilizovat učení.

Je oversampling bezpečný?

Opakované vzorkování menšinových příkladů může pomoci, ale zvyšuje riziko memorování a neprodukuje nové informace. Syntetická metody mohou vytvořit nerealistické body. Resampling se provádí pouze v tréninkové části po rozdělení dat, aby nevznikl leakage.

Jako souvisí imbalance s klasifikačným prahem?

I dobře natrénované skóre může při predvolenom prahu 0,5 poskytovat nevhodný kompromis. Snížení prahu zvýší recall menšinové třídy a často sníží precision. Hranice se volí na validačních datech podle nákladů, ne podle estetickej symetrie.

Může být problémem i nerovnováha v segmentech?

Ano. Celkový počet tříd může vyzerat prijatelne, ale určité jazyky, regiony nebo typy zařízení mají málo pozitivních příkladů. Model potom selhává lokálně. Analýza musí kombinovat cílovou třídu s relevantnými podskupinami a časem.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google Machine Learning Glossary
  • Google Machine Learning Glossary, Metrics

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.