Generalizace a regularizace

Přeučení modelu

Overfitting nastáva, když model prispůsobí parametry tréninkovým datům včetně šumu, náhodných korelací nebo detailů konkrétního sběru natolko, že se zhorší výkon na nových případech z cílové distribuce. Typickým signálom je pokračujúci pokles tréninkové ztráty při stagnaci nebo raste validační chyby. Příčiny zahrnují vysokou kapacitu, malý nebo nereprezentatívny dataset, únik informací a nadmerné ladění podle jedné validační množiny. Ochrana využívá správně rozdělení dat, regularizaci, augmentaci, early stopping a externí test.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-O-25

Odborná definice

Odborná definice

Overfitting nastáva, když model prispůsobí parametry tréninkovým datům včetně šumu, náhodných korelací nebo detailů konkrétního sběru natolko, že se zhorší výkon na nových případech z cílové distribuce. Typickým signálom je pokračujúci pokles tréninkové ztráty při stagnaci nebo raste validační chyby. Příčiny zahrnují vysokou kapacitu, malý nebo nereprezentatívny dataset, únik informací a nadmerné ladění podle jedné validační množiny. Ochrana využívá správně rozdělení dat, regularizaci, augmentaci, early stopping a externí test.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Model na fotografiách výrobků může dosáhnout téměř dokonalý výsledek, protože si zapametal konkrétně pozadí studie, ne tvar výrobku. Na nových fotografiách ze skladu potom selže. To je přeučení na vedlajší vzor, který v tréninku koreloval s labelom. Více dat pomůže pouze tehdy, pokud přináší potřebnou rozmanitost. Náhodné rozdělení může problém skrýt, pokud se téměř stejné snímky dostanou do tréninku i testu. Proto se data dělí podle objektu, času, zákazníka nebo zdroje a po každém kole ladění zůstává nedotknutý finálny test.

Časté otázky

Časté otázky

Jak se overfitting prejaví na learning curve?

Tréninková chyba dále klesá, zatímco validační se přestane zlepšovat nebo roste. Velikost medzery se interpretuje spolu s absolútnym výkonem a nejistotou měření.

Může mít model nízkou chybu na validaci a být preučený?

Ano, pokud se hyperparametre opakovaně ladili podle té určité validační množiny, pokud došlo k duplicite nebo pokud validace nereprezentuje budoucí prostředí.

Jako regularizace snižuje přeučení?

Omezuje efektívnu kapacitu modelu penalizací váh, náhodným vypínáním jednotek, hladšími cielmi nebo jiným priorom. Příliš silná regularizace spůsobí underfitting.

Proč více parametrů automaticky neznamená horší generalizaci?

Moderní modely mohou být silně overparametrizované a navzdory tomu generalizovat díky optimalizaci, datům a implicitným priorom. Riziko se posuzuje empiricky na nezávislých a scenárových testech.

Jako odlíšit overfitting od distribution shift?

Overfitting se prejaví slabou generalizací i na reprezentatívnom teste stejné úlohy. Distribution shift znamená, že produkční data se liší od reference. V praxi mohou působit současně a vyžadují odlišné zásahy.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google Machine Learning Glossary, Overfitting
  • scikit-learn, Learning Curves

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.