Ensemble learning

Bagging

Bagging je ensemble metoda, která trénuje několik modelů na bootstrapových vzorcích původných dat a jejich výstupy agreguje. Bootstrapový vzorek vzniká náhodným výběrem s opakováním, proto jednotlivé modely vidí odlišné kombinace příkladů. Při regresii se predikce obvykle průměrují, při klasifikaci se používá hlasování nebo průměr pravděpodobností. Hlavním přínosem je snižování variability nestabilních modelů, zejména stromů, přičemž systematické zkreslení základního algoritmu nemusí výrazně klesnout.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-B-03

Odborná definice

Odborná definice

Bagging je ensemble metoda, která trénuje několik modelů na bootstrapových vzorcích původných dat a jejich výstupy agreguje. Bootstrapový vzorek vzniká náhodným výběrem s opakováním, proto jednotlivé modely vidí odlišné kombinace příkladů. Při regresii se predikce obvykle průměrují, při klasifikaci se používá hlasování nebo průměr pravděpodobností. Hlavním přínosem je snižování variability nestabilních modelů, zejména stromů, přičemž systematické zkreslení základního algoritmu nemusí výrazně klesnout.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Jeden rozhodovací strom může změnit výsledek už po malé změně tréninkových dat. Bagging proto vytvoří mnoho mírně odlišných tréninkových souborů, naučí na nich samostatné stromy a jejich názory spojí. Náhodné chyby jednotlivých modelů se mohou při agregaci vyrušit, podobně jako průměr více nezávislých měření. Metoda funguje nejlépe, když jsou základní modely dostatečně přesné, ale nerobia zcela stejné chyby. Random forest přidává k baggingu ještě náhodný výběr vlastností při delení stromů.

Časté otázky

Časté otázky

Proč bootstrap vybírá příklady s opakováním?

Výběr s opakováním vytváří datasety stejné velikosti, ale s rozdílným zastúpením záznamů. Některé případy se objeví viackrát a jiné vůbec. Tím vzniká variabilita potřebná na trénování odlišných členů ensemble bez sběru nových dat.

Co jsou out-of-bag příklady?

Pro konkrétní bootstrapový model jsou to záznamy, které se do jeho tréninkové vzorku nedostali. Lze jejich použít na průběžný odhad generalizačnej chyby. Při stromových ensemble poskytují praktickou validaci bez samostatného validačního dělení.

Snižuje bagging bias nebo variance?

Primárně snižuje variance, tedy citlivost modelu na konkrétní tréninkovou vzorek. Pokud jsou základní modely silně systematicky skreslené, průměrování jejich společnou chybu neodstráni. Výsledek závisí i od korelace mezi členmi ensemble.

Kdy bagging neprináša velký úžitok?

Při velmi stabilných algoritmoch mohou všechny modely vytvářet téměř stejné predikce. Slabý přínos nastane i tehdy, když je dataset příliš malý nebo obsahuje zásadnou chybu, kterou preberou všechny bootstrapové vzorku.

Jak se bagging liší od boostingu?

Bagging trénuje členů převážně nezávisle a potom jejich agreguje. Boosting stavia modely postupně, přičemž další člen se zameriava na chyby předchozího ensemble. Bagging stabilizuje, boosting často snižuje i bias, ale může být citlivější na šum.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Breiman, Bagging Predictors, Machine Learning 1996
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.