Nevyvážené dáta a resampling

Undersampling

zníženie počtu príkladov väčšinovej triedy

Undersampling je postup, pri ktorom sa z tréningovej množiny odstráni časť príkladov, najčastejšie z väčšinovej triedy, aby sa zmenil pomer tried alebo znížila výpočtová záťaž. Výber môže byť náhodný, založený na vzdialenosti, klastroch, hranici rozhodovania alebo čistení prekrývajúcich sa bodov. Metóda môže zlepšiť citlivosť na minoritu, no zároveň zahodiť informatívne prípady a skresliť prirodzené prevalencie. Validačné a testovacie dáta sa preto zvyčajne ponechávajú v pôvodnom rozdelení. Použitý algoritmus, seed a identifikátory ponechaných riadkov patria do reprodukovateľnej tréningovej stopy.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-05

Odborná definícia

Odborná definícia

Undersampling je postup, pri ktorom sa z tréningovej množiny odstráni časť príkladov, najčastejšie z väčšinovej triedy, aby sa zmenil pomer tried alebo znížila výpočtová záťaž. Výber môže byť náhodný, založený na vzdialenosti, klastroch, hranici rozhodovania alebo čistení prekrývajúcich sa bodov. Metóda môže zlepšiť citlivosť na minoritu, no zároveň zahodiť informatívne prípady a skresliť prirodzené prevalencie. Validačné a testovacie dáta sa preto zvyčajne ponechávajú v pôvodnom rozdelení. Použitý algoritmus, seed a identifikátory ponechaných riadkov patria do reprodukovateľnej tréningovej stopy.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Pri detekcii podvodu môže byť milión bežných platieb a iba tisíc podvodných. Model sa ľahko naučí označiť takmer všetko za normálne. Undersampling vyberie menšiu, ale reprezentatívnu časť bežných platieb, aby sa počas učenia podvod nestratil v objeme. Ak však náhodne odstránime príliš veľa dát, model prestane poznať legitímne výnimky. Dobrý návrh preto zachováva rozmanité typy väčšinovej triedy a po tréningu znovu kalibruje pravdepodobnosti na reálnu prevalenciu. Pri bezpečnostnej triede sa nesmie odoberať väčšina iba preto, že jej príklady sú početné, ak obsahuje zriedkavé legitímne režimy.

Časté otázky

Časté otázky

Má sa undersampling vykonať pred cross-validation?

Nie nad celým datasetom. Resampling musí prebehnúť samostatne v každom tréningovom folde, inak môže informácia z validačnej časti ovplyvniť výber vzoriek.

Aký je rozdiel medzi random undersamplingom a Tomek links?

Random undersampling odoberá väčšinové body náhodne. Tomek links identifikujú blízke dvojice opačných tried a používajú sa na čistenie nejasnej hranice.

Kedy je undersampling vhodný?

Pri veľmi veľkej väčšinovej triede, obmedzenom výpočte alebo vysokej redundancii. Je menej vhodný, keď je každý väčšinový príklad vzácny alebo bezpečnostne dôležitý.

Mení undersampling pravdepodobnosti modelu?

Áno, model vidí inú prevalenciu než produkcia. Skóre môže byť zle kalibrované, preto sa prah a pravdepodobnosti overujú na pôvodnom validačnom rozdelení.

Je lepší undersampling alebo oversampling?

Závisí od veľkosti dát, šumu, modelu a nákladov chýb. Často sa porovnávajú oba prístupy, triedne váhy a kombinované metódy na rovnakom teste.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • imbalanced-learn, Under-sampling methods Learning from Imbalanced Data

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.