Kvalita dát a klasifikačné učenie

Imbalanced dataset

Nevyvážený dataset

Imbalanced dataset je klasifikačný súbor, v ktorom sú niektoré triedy zastúpené podstatne častejšie než iné. Nerovnováha môže byť prirodzená, napríklad pri zriedkavej poruche, alebo vzniknúť spôsobom zberu a označovania. Model optimalizujúci priemernú stratu môže uprednostniť majoritnú triedu a zanedbať vzácne prípady, hoci majú vyšší praktický význam. Samotný pomer tried neurčuje náročnosť, dôležité sú prekrývanie distribúcií, šum štítkov, počet príkladov a náklady chýb. Riešenia zahŕňajú váženie straty, resampling, vhodný prah, cielený zber dát a metriky citlivé na minority.

Posledná odborná revízia
29. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-08

Odborná definícia

Odborná definícia

Imbalanced dataset je klasifikačný súbor, v ktorom sú niektoré triedy zastúpené podstatne častejšie než iné. Nerovnováha môže byť prirodzená, napríklad pri zriedkavej poruche, alebo vzniknúť spôsobom zberu a označovania. Model optimalizujúci priemernú stratu môže uprednostniť majoritnú triedu a zanedbať vzácne prípady, hoci majú vyšší praktický význam. Samotný pomer tried neurčuje náročnosť, dôležité sú prekrývanie distribúcií, šum štítkov, počet príkladov a náklady chýb. Riešenia zahŕňajú váženie straty, resampling, vhodný prah, cielený zber dát a metriky citlivé na minority.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

V továrni môže byť zo stotisíc výrobkov iba sto chybných. Klasifikátor, ktorý vždy povie bez chyby, dosiahne 99,9 percenta accuracy a pritom nenájde jediný problém. Nerovnováha teda nemení len čísla v tabuľke, ale aj to, čo sa modelu oplatí predikovať. Vývojár môže zvýšiť váhu chybných kusov, doplniť reálne príklady alebo zmeniť rozhodovací prah. Umelé vyrovnanie však nesmie vytvoriť nereálne vzory. Testovacia sada má zachovať prevádzkový výskyt, aby bolo viditeľné, koľko falošných poplachov vznikne pri skutočnom objeme výroby.

Časté otázky

Časté otázky

Aký pomer tried už znamená problém?

Neexistuje univerzálna hranica. Pomer 10 ku 1 môže byť ľahký pri dobre oddelených triedach, zatiaľ čo 3 ku 1 môže byť ťažký pri šume a prekrývaní. Rozhoduje výkon a náklad chýb.

Prečo accuracy nie je vhodná hlavná metrika?

Dominantná trieda môže zakryť nulový recall minority. Vhodnejšie sú precision, recall, F1, PR AUC, confusion matrix a prevádzkové náklady pre konkrétne typy omylov.

Čo robí oversampling?

Zvyšuje zastúpenie minoritných príkladov ich opakovaním alebo syntetickou tvorbou. Pomáha optimalizácii, ale môže zvýšiť preučenie, preniesť chyby anotácie alebo vytvoriť body mimo reálnej distribúcie.

Má sa validačná sada tiež vyvážiť?

Na porovnávanie algoritmov možno použiť kontrolovaný rez, no finálne hodnotenie má odrážať skutočnú prevalenciu. Inak sa nesprávne odhadne počet poplachov, pozitívna prediktívna hodnota a kapacita obsluhy.

Ako sa volí klasifikačný prah pri nerovnováhe?

Prah sa nastaví podľa požadovaného recall, precision, nákladovej funkcie alebo kapacity následnej kontroly. Nemá sa automaticky ponechať na 0,5, pretože skóre a prevalencia môžu vyžadovať inú hranicu.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Google Machine Learning Crash Course, Class-imbalanced datasets (developers.google.com)
  • Google Machine Learning Glossary, class-imbalanced dataset (developers.google.com)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.