Odborná definice
Odborná definice
Bagging je ensemble metoda, která trénuje několik modelů na bootstrapových vzorcích původných dat a jejich výstupy agreguje. Bootstrapový vzorek vzniká náhodným výběrem s opakováním, proto jednotlivé modely vidí odlišné kombinace příkladů. Při regresii se predikce obvykle průměrují, při klasifikaci se používá hlasování nebo průměr pravděpodobností. Hlavním přínosem je snižování variability nestabilních modelů, zejména stromů, přičemž systematické zkreslení základního algoritmu nemusí výrazně klesnout.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Jeden rozhodovací strom může změnit výsledek už po malé změně tréninkových dat. Bagging proto vytvoří mnoho mírně odlišných tréninkových souborů, naučí na nich samostatné stromy a jejich názory spojí. Náhodné chyby jednotlivých modelů se mohou při agregaci vyrušit, podobně jako průměr více nezávislých měření. Metoda funguje nejlépe, když jsou základní modely dostatečně přesné, ale nerobia zcela stejné chyby. Random forest přidává k baggingu ještě náhodný výběr vlastností při delení stromů.
Časté otázky
Časté otázky
Proč bootstrap vybírá příklady s opakováním?
Výběr s opakováním vytváří datasety stejné velikosti, ale s rozdílným zastúpením záznamů. Některé případy se objeví viackrát a jiné vůbec. Tím vzniká variabilita potřebná na trénování odlišných členů ensemble bez sběru nových dat.
Co jsou out-of-bag příklady?
Pro konkrétní bootstrapový model jsou to záznamy, které se do jeho tréninkové vzorku nedostali. Lze jejich použít na průběžný odhad generalizačnej chyby. Při stromových ensemble poskytují praktickou validaci bez samostatného validačního dělení.
Snižuje bagging bias nebo variance?
Primárně snižuje variance, tedy citlivost modelu na konkrétní tréninkovou vzorek. Pokud jsou základní modely silně systematicky skreslené, průměrování jejich společnou chybu neodstráni. Výsledek závisí i od korelace mezi členmi ensemble.
Kdy bagging neprináša velký úžitok?
Při velmi stabilných algoritmoch mohou všechny modely vytvářet téměř stejné predikce. Slabý přínos nastane i tehdy, když je dataset příliš malý nebo obsahuje zásadnou chybu, kterou preberou všechny bootstrapové vzorku.
Jak se bagging liší od boostingu?
Bagging trénuje členů převážně nezávisle a potom jejich agreguje. Boosting stavia modely postupně, přičemž další člen se zameriava na chyby předchozího ensemble. Bagging stabilizuje, boosting často snižuje i bias, ale může být citlivější na šum.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Breiman, Bagging Predictors, Machine Learning 1996
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
