Modely a architektúry · Ensemble modely a rozhodovacie stromy

Náhodný les

Random forest

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-01

Odborná definícia

Význam a odborné vymedzenie pojmu

Random forest je ansámbl rozhodovacích stromov, v ktorom sa jednotlivé stromy učia na náhodne zvolených vzorkách dát a pri delení uzlov zvažujú iba náhodný podvýber príznakov. Klasifikačný výstup vzniká hlasovaním, regresný výstup priemerovaním. Kombinácia baggingu a náhodnosti príznakov znižuje koreláciu medzi stromami, čím spravidla obmedzuje rozptyl oproti jednému hlbokému stromu. Nie každá implementácia používa bootstrap a konkrétne nastavenia ovplyvňujú aj out-of-bag odhad.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Predstavte si porotu mnohých rozhodovacích stromov. Každý dostane trochu inú verziu tréningových dát a pri rozhodovaní vidí iba časť dostupných premenných. Jeden strom sa môže nechať zviesť náhodnou zvláštnosťou, ale súhrnný hlas býva stabilnejší. Náhodný les preto často funguje dobre bez rozsiahleho ladenia a zvláda nelineárne vzťahy. Jeho predikcia je však výsledkom kolektívu, takže jednoduché vysvetlenie jedným pravidlom zvyčajne nie je možné.

Časté otázky

Otázky, ktoré spresňujú význam

V čom sa random forest líši od baggingu stromov?

Bagging náhodne mení tréningové vzorky, kým random forest navyše obmedzuje množinu príznakov dostupných pri každom delení. Druhá vrstva náhodnosti znižuje podobnosť stromov.

Čo znamená out-of-bag hodnotenie?

Pri bootstrape zostáva časť záznamov mimo vzorky konkrétneho stromu. Predikcie stromov, ktoré daný záznam nevideli, možno spojiť do interného odhadu generalizačnej chyby.

Sú hodnoty feature importance spoľahlivým vysvetlením?

Nie bez kontroly. Impurity importance zvýhodňuje niektoré typy premenných a korelované príznaky si môžu význam rozdeliť. Vhodné je doplniť permutačnú analýzu a doménové overenie.

Ako riešiť nevyvážené triedy?

Možno použiť váhy tried, stratifikovaný resampling, vhodný prah alebo vyvážené varianty lesa. Výsledok sa má hodnotiť metrikami citlivými na minoritnú triedu.

Kedy random forest nemusí byť vhodný?

Pri veľmi riedkych vysokorozmerných textových dátach, pri potrebe hladkej extrapolácie alebo pri extrémne prísnej latencii môže byť vhodnejší lineárny, boostingový alebo špecializovaný model.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Breiman, Random Forests, Machine Learning, 2001

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.