Modely a architektúry · Dáta a klasifikačné modely

Nevyváženosť tried

Class imbalance

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-11

Odborná definícia

Význam a odborné vymedzenie pojmu

Class imbalance je stav, keď majú cieľové triedy výrazne rozdielne zastúpenie alebo keď je málo príkladov triedy s najvyšším rozhodovacím významom. Model optimalizovaný na priemernú stratu môže preferovať väčšinovú triedu a dosiahnuť vysokú accuracy pri slabom zachytení zriedkavých prípadov. Riešenia zahŕňajú váženie straty, resampling, generovanie dát, threshold tuning, vhodné metriky a zber nových príkladov. Nerovnováha sama neurčuje problém, rozhodujú aj náklady chýb, separovateľnosť a kvalita označení.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Ak je iba jedna zo sto transakcií podvodná, model, ktorý vždy povie bez podvodu, dosiahne 99 percent accuracy a pritom je úplne nepoužiteľný. Cieľom nie je mechanicky vyrovnať počty na polovicu, ale naučiť systém zachytiť rizikovú triedu pri prijateľnom množstve falošných poplachov. Pri tréningu možno podvody zvýrazniť váhou alebo samplingom, pri nasadení sa prah nastaví podľa nákladov a kapacity vyšetrovateľov. Testovacia sada má zachovať realistickú prevalenciu, inak sa prevádzkové metriky skreslia.

Časté otázky

Otázky, ktoré spresňujú význam

Prečo accuracy pri nevyvážených triedach zavádza?

Je dominovaná väčšinovou triedou a neukáže, či model zachytil zriedkavý, ale dôležitý jav. Vhodnejšie sú precision, recall, PR AUC, confusion matrix a nákladovo vážené metriky. Výber závisí od následkov false positive a false negative.

Čo robí class weighting?

Chybám na vybranej triede priradí väčšiu váhu v stratovej funkcii. Optimalizátor potom venuje viac pozornosti príkladom, ktoré by inak prekryla väčšina. Príliš vysoká váha môže zvýšiť falošné poplachy alebo destabilizovať učenie.

Je oversampling bezpečný?

Opakované vzorkovanie menšinových príkladov môže pomôcť, ale zvyšuje riziko memorovania a neprodukuje nové informácie. Syntetické metódy môžu vytvoriť nerealistické body. Resampling sa vykonáva iba v tréningovej časti po rozdelení dát, aby nevznikol leakage.

Ako súvisí imbalance s klasifikačným prahom?

Aj dobre natrénované skóre môže pri predvolenom prahu 0,5 poskytovať nevhodný kompromis. Zníženie prahu zvýši recall menšinovej triedy a často zníži precision. Hranica sa volí na validačných dátach podľa nákladov, nie podľa estetickej symetrie.

Môže byť problémom aj nerovnováha v segmentoch?

Áno. Celkový počet tried môže vyzerať prijateľne, ale určité jazyky, regióny alebo typy zariadení majú málo pozitívnych príkladov. Model potom zlyháva lokálne. Analýza musí kombinovať cieľovú triedu s relevantnými podskupinami a časom.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Google Machine Learning Glossary
  • Google Machine Learning Glossary, Metrics

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.