Ensemble modely

Gradientní posilování

Gradient boosting je aditívna ensemble metoda, která buduje model po etapách a v každé etape přidává slabý learner aproximujúci záporný gradient zvolené ztrátové funkce vzhledem na aktuálně predikce. Nejčastěji se používají plytké rozhodovací stromy. Nový strom opravuje systematické chyby předchozího souboru, přičemž learning rate řídí velikost příspěvku. Počet stromů, jejich hloubka, subsampling a regularizace určují kompromis mezi podučením a preučením. Xgboost, Lightgbm a Catboost jsou optimalizované varianty, ne synonyma základního algoritmu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-G-16

Odborná definice

Odborná definice

Gradient boosting je aditívna ensemble metoda, která buduje model po etapách a v každé etape přidává slabý learner aproximujúci záporný gradient zvolené ztrátové funkce vzhledem na aktuálně predikce. Nejčastěji se používají plytké rozhodovací stromy. Nový strom opravuje systematické chyby předchozího souboru, přičemž learning rate řídí velikost příspěvku. Počet stromů, jejich hloubka, subsampling a regularizace určují kompromis mezi podučením a preučením. Xgboost, Lightgbm a Catboost jsou optimalizované varianty, ne synonyma základního algoritmu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si tím odhadujúci cenu domu. První jednoduchý strom udělá hrubý odhad. Druhý se neučí cenu od začátku, ale zkoumá, kde první model systematicky prestrelil nebo podstrelil. Další stromy přidávají menší korekce, až součet vytvoří přesný model. Pokud každý opravný krok dostane příliš velkou váhu nebo stromy rastou příliš hlboko, soubor začne kopírovat náhodné zvláštnosti tréninku. Gradient v názve označuje směr zlepšení ztráty v prostoru predikcí, ačkoli samotnými slabými modely bývají rozhodovací stromy.

Časté otázky

Časté otázky

Proč se metoda volá gradient boosting?

Každý nový člen aproximuje směr, který najrýchlejšie snižuje diferencovatelnou ztrátu vzhledem na aktuálně predikce. Boosting označuje postupné skladání slabších modelů do silného souboru.

Jak se gradient boosting liší od random forest?

Random forest trénuje stromy převážně nezávisle na bootstrap vzorcích a priemeruje jejich. Gradient boosting stavia stromy sekvenčne, přičemž každý reaguje na chyby už existujúceho souboru.

Které hyperparametre jsou nejdůležitější?

Learning rate, počet stromů, hloubka nebo počet listů, minimální velikost listu a subsampling. Menší learning rate často potřebuje více stromů, ale může přinést stabilnejšiu generalizaci.

Ví gradient boosting pracovat s chýbajúcimi a kategóriovými údajmi?

Závisí na implementace. Některé knižnice se učí směr chybějících hodnot nebo používají špeciálne kódování kategorií, jiné vyžadují explicitní predprípravu.

Jsou pravděpodobnosti gradient boosting modelu kalibrované?

Ne nevyhnutelně. Optimalizace log loss pomáhá, ale hluboké stromy, nevyvážené data a výběr prahu mohou vytvořit nadmernou istotu. Kalibrace se ověřuje na oddělené množině.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.