Prediktívne modelování

Regression

Regression je rodina štatistických a strojovo učiacich metod, které odhadují spojitou cílovou hodnotu nebo jinou podmienenou charakteristiku rozdělení na základě vstupních proměnných. Model může být lineární, stromový, neuronový, kernelový nebo pravděpodobnostní. Trénink minimalizuje zvolenou ztrátu, například MSE, MAE, Huberovu nebo kvantilovou ztrátu. Kvalita se posuzuje na neviděných datech a musí se rozlišovat interpolace od extrapolace. Logistická regrese navzdory názvu řeší klasifikaci.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-10

Odborná definice

Odborná definice

Regression je rodina štatistických a strojovo učiacich metod, které odhadují spojitou cílovou hodnotu nebo jinou podmienenou charakteristiku rozdělení na základě vstupních proměnných. Model může být lineární, stromový, neuronový, kernelový nebo pravděpodobnostní. Trénink minimalizuje zvolenou ztrátu, například MSE, MAE, Huberovu nebo kvantilovou ztrátu. Kvalita se posuzuje na neviděných datech a musí se rozlišovat interpolace od extrapolace. Logistická regrese navzdory názvu řeší klasifikaci.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Regresný model odpovídá číslem, například očakávanou spotřebou, časem doručení nebo cenou. Nejde pouze o priamku. Stejnou úlohu může řešit les stromů nebo neuronová síť, přičemž každý model jinak zachycuje nelinearity a nejistotu. Výsledek závisí i od toho, jakou chybu během učení trestáme. Model optimalizovaný na průměrnou štvorcovou chybu reaguje silně na extrémy, zatímco kvantilová regrese může odhadovat hornou hranici potřebnou pro kapacitné plánování.

Časté otázky

Časté otázky

Jak se regrese liší od klasifikace?

Regrese predpovedá číselnou hodnotu nebo kvantil, klasifikace třídu nebo pravděpodobnost třídy. Hranice závisí na cíle, ne od typu vstupních proměnných.

Která metrika je vhodná pro regresi?

MAE je lahko interpretovatelná a méně citlivá na extrémy, RMSE zvýrazňuje velké chyby a R² porovnává vysvetlený rozptyl. Výběr má odpovídat nákladem chyb.

Jako řešit odlehlé hodnoty?

Nejprve je třeba ověřit, či jde o chybu nebo legitimní vzácny jev. Potom lze použít robustnou ztrátu, transformaci cíle, segmentový model nebo explicitní detekci extrémů.

Proč je extrapolace riziková?

Model mimo rozsahu tréninkových dat nemá empirickou oporu. Stromy často zůstanou při krajných hodnotách, lineární model pokračuje v trende a neuronová síť se může správat nepredvídatelne.

Jak se vyjadřuje nejistota predikce?

Pomocí predikčných intervalů, kvantilů, Bayesovských modelů, konformnej predikce nebo ansámblů. Interval je třeba kalibrovat na samostatných datech.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google Machine Learning Crash Course, Linear Regression

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.