Nevyvážené data a resampling

snížení počtu příkladů většinové třídy

Undersampling je postup, při kterém se z tréninkové množiny odstraní část příkladů, nejčastěji z většinové třídy, aby se změnil poměr tříd nebo znížila výpočetní záťaž. Výběr může být náhodný, založený na vzdálenosti, klastroch, hranici rozhodování nebo čištění prekrývajúcich se bodů. Metoda může zlepšit citlivost na minoritu, ale zároveň zahodit informatívne případy a skreslit prirodzené prevalence. Validační a testovací data se proto obvykle ponechávají v původním rozdělení. Použitý algoritmus, seed a identifikátory ponechaných riadků patří do reprodukovatelnej tréninkové stopy.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-05

Odborná definice

Odborná definice

Undersampling je postup, při kterém se z tréninkové množiny odstraní část příkladů, nejčastěji z většinové třídy, aby se změnil poměr tříd nebo znížila výpočetní záťaž. Výběr může být náhodný, založený na vzdálenosti, klastroch, hranici rozhodování nebo čištění prekrývajúcich se bodů. Metoda může zlepšit citlivost na minoritu, ale zároveň zahodit informatívne případy a skreslit prirodzené prevalence. Validační a testovací data se proto obvykle ponechávají v původním rozdělení. Použitý algoritmus, seed a identifikátory ponechaných riadků patří do reprodukovatelnej tréninkové stopy.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při detekci podvodu může být milión běžných platieb a pouze tisíc podvodných. Model se lahko naučí označit téměř vše za normálně. Undersampling vybere menší, ale reprezentatívnu část běžných platieb, aby se během učení podvod nestratil v objeme. Pokud však náhodně odstránime příliš mnoho dat, model přestane poznat legitimní výjimky. Dobrý návrh proto zachovává rozmanité typy většinové třídy a po tréninku znovu kalibruje pravděpodobnosti na reálnou prevalenci. Při bezpečnostnej třídě se nesmí odoberat večšina pouze proto, že její příklady jsou početné, pokud obsahuje vzácné legitimní režimy.

Časté otázky

Časté otázky

Má se undersampling provést před cross-validation?

Ne nad celým datasetem. Resampling musí proběhnout samostatně v každém tréninkovém folde, jinak může informace z validační části ovlivnit výběr vzorků.

Jaký je rozdíl mezi random undersamplingom a Tomek links?

Random undersampling odebírá večšinové body náhodně. Tomek links identifikují blízké dvojice opačných tříd a používají se na čištění nejasnej hranice.

Kdy je undersampling vhodný?

Při velmi velké většinové třídě, obmedzenom výpočtu nebo vysoké redundancii. Je méně vhodný, když je každý večšinový příklad vzácny nebo bezpečnostne důležitý.

Mění undersampling pravděpodobnosti modelu?

Ano, model vidí jinou prevalenci než produkce. Skóre může být špatně kalibrované, proto se práh a pravděpodobnosti overují na původním validačním rozdělení.

Je lepší undersampling nebo oversampling?

Závisí na velikosti dat, šumu, modelu a nákladů chyb. Často se porovnávají oba přístupy, třídní váhy a kombinované metody na stejném teste.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • imbalanced-learn, Under-sampling methods Learning from Imbalanced Data

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.