Revize: 1. august 2026

Učení z časového rozdílu

Temporal-difference learning, zkráceně TD learning, aktualizuje odhad hodnoty ze súčtu okamžitej odměny a diskontovaného odhadu nasledujúceho stavu. Rozdíl mezi týmto bootstrapovým cílem a aktuálnym odhadom se nazýva TD error. Metoda se může učit po každém kroku bez čakání na koniec epizódy a tvoří základ algoritmů SARSA, Q-learning a actor-critic. Protože cíl sám závisí na odhadu modelu, kombinace aproximace funkce, off-policy dat a agresívnych aktualizací může vést k nestabilite.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-20

Odborná definice

Odborná definice

Temporal-difference learning, zkráceně TD learning, aktualizuje odhad hodnoty ze súčtu okamžitej odměny a diskontovaného odhadu nasledujúceho stavu. Rozdíl mezi týmto bootstrapovým cílem a aktuálnym odhadom se nazýva TD error. Metoda se může učit po každém kroku bez čakání na koniec epizódy a tvoří základ algoritmů SARSA, Q-learning a actor-critic. Protože cíl sám závisí na odhadu modelu, kombinace aproximace funkce, off-policy dat a agresívnych aktualizací může vést k nestabilite.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Agent nemusí čekat, zatímco dokončí celou hru, aby zistil, či byl posledný krok dobrý. Po každém ťahu porovná starý odhad situace s novou odměnou a s tím, jako nádejne vypadá další stav. Pokud je součet vyšší, hodnotu zvýší. Pokud je nižší, sníží ji. Učí se tedy z prekvapení mezi dvěma po sebe idúcimi odhadmi. Výhodou je rychlá zpětná vazba, nevýhodou možnost, že chybný budúci odhad se přenese do předchozích stavů.

Časté otázky

Časté otázky

Jak se TD learning liší od Monte Carlo učení?

Monte Carlo používá skutečný návrat až po skončení epizódy. TD se aktualizuje dříve pomocí odhadu dalšího stavu.

Co znamená bootstrapping?

Cíl aktualizace obsahuje hodnotu, kterou systém sám odhadol, místo zcela pozorovaného výsledku.

Co je TD(0)?

Najjednoduchší variant používá odměnu a odhad bezprostredne nasledujúceho stavu. TD lambda kombinuje informaci z více časových vzdáleností.

Je TD learning on-policy nebo off-policy?

Může být oboje. SARSA se učí hodnotu používanej politiky, Q-learning směřuje k chamtivej cílové politice.

Jak se sleduje nestabilita?

Kontrolují se TD chyby, rozsah hodnot, gradienty, citlivost na seed a výkon odděleně od tréninkového replay bufferu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Sutton, Learning to Predict by the Methods of Temporal Differences, 1988 Sutton a Barto, Reinforcement Learning, 2nd edition

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.