Štatistické učenie a generalizácia

Bias-variance tradeoff

Kompromis medzi skreslením a variabilitou

Bias-variance tradeoff opisuje napätie medzi systematickou chybou modelu a jeho citlivosťou na konkrétnu tréningovú vzorku. Model s vysokým biasom je príliš obmedzený a nezachytí podstatný vzťah, čo vedie k underfittingu. Model s vysokou variance sa nadmerne prispôsobí detailom a šumu tréningových dát, takže jeho výsledky sa výrazne menia pri inom výbere vzorky. Pri kvadratickej strate možno očakávanú chybu rozložiť na bias, variance a ireducibilný šum. V modernej hlbokej AI je obraz zložitejší, no princíp zostáva užitočný pri diagnostike generalizácie.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-B-16

Odborná definícia

Odborná definícia

Bias-variance tradeoff opisuje napätie medzi systematickou chybou modelu a jeho citlivosťou na konkrétnu tréningovú vzorku. Model s vysokým biasom je príliš obmedzený a nezachytí podstatný vzťah, čo vedie k underfittingu. Model s vysokou variance sa nadmerne prispôsobí detailom a šumu tréningových dát, takže jeho výsledky sa výrazne menia pri inom výbere vzorky. Pri kvadratickej strate možno očakávanú chybu rozložiť na bias, variance a ireducibilný šum. V modernej hlbokej AI je obraz zložitejší, no princíp zostáva užitočný pri diagnostike generalizácie.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Ak na body v grafe priložíte priamku, môže prehliadnuť skutočné zakrivenie, to je vysoký bias. Ak vytvoríte veľmi zvlnenú krivku, ktorá prejde cez každý tréningový bod, zachytí aj náhodný šum, to je vysoká variance. Cieľom nie je zvoliť model presne uprostred podľa zložitosti, ale nájsť konfiguráciu, ktorá funguje na nových dátach. Viac dát, regularizácia, ensemble alebo vhodnejšie vlastnosti môžu meniť kompromis. Rozhodujúca je validačná metodika, nie samotný tréningový výkon.

Časté otázky

Časté otázky

Ako sa vysoký bias prejaví v metrikách?

Tréningová aj validačná chyba zostávajú relatívne vysoké a blízke. Model nedokáže dostatočne vysvetliť ani dáta, na ktorých sa učil. Pomôcť môže bohatšia reprezentácia, vhodnejšia architektúra alebo menšia regularizácia.

Ako sa rozpozná vysoká variance?

Tréningový výkon je veľmi dobrý, ale validačný výrazne horší alebo nestabilný medzi foldmi. Model reaguje na malé zmeny datasetu. Pomáha viac dát, regularizácia, skoré zastavenie, bagging alebo zjednodušenie modelu.

Znižuje viac tréningových dát bias?

Často znižuje variance, pretože odhad je stabilnejší. Bias spôsobený nevhodnou triedou modelov alebo chybným cieľom nemusí zmiznúť ani pri obrovskom datasete. Viac rovnakým spôsobom skreslených dát môže problém upevniť.

Ako súvisí bagging s variance?

Bagging priemeruje predikcie modelov naučených na odlišných vzorkách. Ak ich chyby nie sú dokonale korelované, náhodné odchýlky sa zmenšia. Preto je účinný najmä pri nestabilných algoritmoch, ako sú hlboké rozhodovacie stromy.

Platí klasický rozklad aj pre klasifikačnú accuracy?

Presný rozklad bias plus variance plus šum je najčistejší pri kvadratickej strate. Pre klasifikáciu existujú iné formulácie a intuícia sa používa opatrne. Diagnostika sa má opierať o learning curves a opakovanú validáciu.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Google Machine Learning Glossary
  • Breiman, Bagging Predictors, Machine Learning 1996

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.