Stromové modely a tabulkové data

optimalizované gradientní posilování stromů

Xgboost je knihovna a algoritmický rámec pro gradient boosting, nejčastěji nad rozhodovacími stromami. Model se skládá aditívne, každý nový strom koriguje reziduálnu chybu předchozího souboru podle diferenciovatelnej cílové funkce. Implementace používá regularizaci stromů, shrinkage, subsampling, stlpcové vzorkování, zpracování chybějících hodnot a efektivně histogramové nebo distribuované postupy. Xgboost není jeden pevný model, výsledek závisí na boosteru, objective, hloubky, learning rate a validačního protokolu. Při kategóriách a časových datech je třeba zabránit leakage.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-X-12

Odborná definice

Odborná definice

Xgboost je knihovna a algoritmický rámec pro gradient boosting, nejčastěji nad rozhodovacími stromami. Model se skládá aditívne, každý nový strom koriguje reziduálnu chybu předchozího souboru podle diferenciovatelnej cílové funkce. Implementace používá regularizaci stromů, shrinkage, subsampling, stlpcové vzorkování, zpracování chybějících hodnot a efektivně histogramové nebo distribuované postupy. Xgboost není jeden pevný model, výsledek závisí na boosteru, objective, hloubky, learning rate a validačního protokolu. Při kategóriách a časových datech je třeba zabránit leakage.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Xgboost nevytvorí jeden obrovský strom. Stavia sériu menších stromů, přičemž každý se soustřeďuje na chyby, které zostali po předchozích. Výsledná predikce je součtem jejich príspevků. Tento přístup bývá silný při tabulkových datech, kde jsou vztahy nelineárně a atributy se ovlivňují. Velký počet hlubokých stromů však lahko preučí data. Proto se používá validační množina, early stopping, regularizace a kontrola úniků z budúcnosti. Při nerovnovážnych třídách se práh a váhy volia podle nákladů chyb, ne podle samotnej accuracy.

Časté otázky

Časté otázky

Je Xgboost pouze klasifikátor?

Ne. Podporuje regresi, ranking, klasifikaci, survival úlohy a vlastní cílové funkce, pokud splňají požadavky na gradienty a hessián.

Co znamená learning rate v Xgboost?

Škáluje příspěvek každého nového stromu. Menší hodnota obvykle vyžaduje více boosting kůl a může zlepšit generalizaci.

Jako zpracovává chybějící hodnoty?

Při učení rozdělení hledá predvolený směr pro chybějící hodnoty. To nenahrádza analýzu, proč údaje chýbají a či vzor chýbání přenáší leakage.

Kdy je Xgboost nevhodný?

Při surovom obraze, zvuku nebo dlouhém textu bez vhodné reprezentace. Tam často dominují neuronové architektury, ačkoli jejich embeddingy lze následně vložit do stromového modelu.

Jak se vysvětluje predikce Xgboost?

Lze použít tree SHAP, příspěvky stromů, gain nebo permutation importance. Každá metoda odpovídá na jinou otázku a korelované atributy komplikují interpretaci.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • XGBoost, A Scalable Tree Boosting System XGBoost Documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.