Odborná definice
Odborná definice
Undersampling je postup, při kterém se z tréninkové množiny odstraní část příkladů, nejčastěji z většinové třídy, aby se změnil poměr tříd nebo znížila výpočetní záťaž. Výběr může být náhodný, založený na vzdálenosti, klastroch, hranici rozhodování nebo čištění prekrývajúcich se bodů. Metoda může zlepšit citlivost na minoritu, ale zároveň zahodit informatívne případy a skreslit prirodzené prevalence. Validační a testovací data se proto obvykle ponechávají v původním rozdělení. Použitý algoritmus, seed a identifikátory ponechaných riadků patří do reprodukovatelnej tréninkové stopy.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Při detekci podvodu může být milión běžných platieb a pouze tisíc podvodných. Model se lahko naučí označit téměř vše za normálně. Undersampling vybere menší, ale reprezentatívnu část běžných platieb, aby se během učení podvod nestratil v objeme. Pokud však náhodně odstránime příliš mnoho dat, model přestane poznat legitimní výjimky. Dobrý návrh proto zachovává rozmanité typy většinové třídy a po tréninku znovu kalibruje pravděpodobnosti na reálnou prevalenci. Při bezpečnostnej třídě se nesmí odoberat večšina pouze proto, že její příklady jsou početné, pokud obsahuje vzácné legitimní režimy.
Časté otázky
Časté otázky
Má se undersampling provést před cross-validation?
Ne nad celým datasetem. Resampling musí proběhnout samostatně v každém tréninkovém folde, jinak může informace z validační části ovlivnit výběr vzorků.
Jaký je rozdíl mezi random undersamplingom a Tomek links?
Random undersampling odebírá večšinové body náhodně. Tomek links identifikují blízké dvojice opačných tříd a používají se na čištění nejasnej hranice.
Kdy je undersampling vhodný?
Při velmi velké většinové třídě, obmedzenom výpočtu nebo vysoké redundancii. Je méně vhodný, když je každý večšinový příklad vzácny nebo bezpečnostne důležitý.
Mění undersampling pravděpodobnosti modelu?
Ano, model vidí jinou prevalenci než produkce. Skóre může být špatně kalibrované, proto se práh a pravděpodobnosti overují na původním validačním rozdělení.
Je lepší undersampling nebo oversampling?
Závisí na velikosti dat, šumu, modelu a nákladů chyb. Často se porovnávají oba přístupy, třídní váhy a kombinované metody na stejném teste.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- imbalanced-learn, Under-sampling methods Learning from Imbalanced Data
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
