Ensemble modely a rozhodovací stromy

Náhodný les

Random forest je ansámbl rozhodovacích stromů, ve kterém se jednotlivé stromy učí na náhodně zvolených vzorcích dat a při delení uzlů zvažují pouze náhodný podvýber příznaků. Klasifikační výstup vzniká hlasováním, regresný výstup priemerováním. Kombinace baggingu a náhodnosti příznaků snižuje korelaci mezi stromami, čím zpravidla omezuje rozptyl oproti jednomu hlbokému stromu. Ne každá implementace používá bootstrap a konkrétně nastavení ovlivňují i out-of-bag odhad.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-01

Odborná definice

Odborná definice

Random forest je ansámbl rozhodovacích stromů, ve kterém se jednotlivé stromy učí na náhodně zvolených vzorcích dat a při delení uzlů zvažují pouze náhodný podvýber příznaků. Klasifikační výstup vzniká hlasováním, regresný výstup priemerováním. Kombinace baggingu a náhodnosti příznaků snižuje korelaci mezi stromami, čím zpravidla omezuje rozptyl oproti jednomu hlbokému stromu. Ne každá implementace používá bootstrap a konkrétně nastavení ovlivňují i out-of-bag odhad.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si porotu mnoha rozhodovacích stromů. Každý dostane trochu jinou verzi tréninkových dat a při rozhodování vidí pouze část dostupných proměnných. Jeden strom se může nechat zviesť náhodnou zvláštností, ale súhrnný hlas bývá stabilnější. Náhodný les proto často funguje dobře bez rozsiahleho ladění a zvláda nelineárně vztahy. Jeho predikce je však výsledkem kolektívu, takže jednoduché vysvětlení jedním pravidlem obvykle není možné.

Časté otázky

Časté otázky

V čem se random forest liší od baggingu stromů?

Bagging náhodně mění tréninková vzorku, zatímco random forest navíc omezuje množinu příznaků dostupných při každém delení. Druhá vrstva náhodnosti snižuje podobnost stromů.

Co znamená out-of-bag hodnocení?

Při bootstrape zůstává část záznamů mimo vzorku konkrétního stromu. Predikce stromů, které daný záznam nevideli, lze spojit do interného odhadu generalizačnej chyby.

Jsou hodnoty feature importance spolahlivým vysvětlením?

Ne bez kontroly. Impurity importance zvýhodňuje některé typy proměnných a korelované příznaky si mohou význam rozdelit. Vhodné je doplnit permutačnou analýzu a doménové ověření.

Jako řešit nevyvážené třídy?

Lze použít váhy tříd, stratifikovaný resampling, vhodný práh nebo vyvážené varianty lesa. Výsledek se má hodnotit metrikami citlivými na minoritnou třídu.

Kdy random forest nemusí být vhodný?

Při velmi riedkych vysokorozmerných textových datech, při potrebe hladkej extrapolace nebo při extrémně prísnej latencii může být vhodnější lineární, boostingový nebo specializovaný model.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Breiman, Random Forests, Machine Learning, 2001

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.