Posilňované učenie a odhad hodnôt

Temporal-difference learning

Učenie z časového rozdielu

Temporal-difference learning, skrátene TD learning, aktualizuje odhad hodnoty zo súčtu okamžitej odmeny a diskontovaného odhadu nasledujúceho stavu. Rozdiel medzi týmto bootstrapovým cieľom a aktuálnym odhadom sa nazýva TD error. Metóda sa môže učiť po každom kroku bez čakania na koniec epizódy a tvorí základ algoritmov SARSA, Q-learning a actor-critic. Pretože cieľ sám závisí od odhadu modelu, kombinácia aproximácie funkcie, off-policy dát a agresívnych aktualizácií môže viesť k nestabilite.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-20

Odborná definícia

Odborná definícia

Temporal-difference learning, skrátene TD learning, aktualizuje odhad hodnoty zo súčtu okamžitej odmeny a diskontovaného odhadu nasledujúceho stavu. Rozdiel medzi týmto bootstrapovým cieľom a aktuálnym odhadom sa nazýva TD error. Metóda sa môže učiť po každom kroku bez čakania na koniec epizódy a tvorí základ algoritmov SARSA, Q-learning a actor-critic. Pretože cieľ sám závisí od odhadu modelu, kombinácia aproximácie funkcie, off-policy dát a agresívnych aktualizácií môže viesť k nestabilite.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Agent nemusí čakať, kým dokončí celú hru, aby zistil, či bol posledný krok dobrý. Po každom ťahu porovná starý odhad situácie s novou odmenou a s tým, ako nádejne vyzerá ďalší stav. Ak je súčet vyšší, hodnotu zvýši. Ak je nižší, zníži ju. Učí sa teda z prekvapenia medzi dvoma po sebe idúcimi odhadmi. Výhodou je rýchla spätná väzba, nevýhodou možnosť, že chybný budúci odhad sa prenesie do predchádzajúcich stavov.

Časté otázky

Časté otázky

Ako sa TD learning líši od Monte Carlo učenia?

Monte Carlo používa skutočný návrat až po skončení epizódy. TD sa aktualizuje skôr pomocou odhadu ďalšieho stavu.

Čo znamená bootstrapping?

Cieľ aktualizácie obsahuje hodnotu, ktorú systém sám odhadol, namiesto úplne pozorovaného výsledku.

Čo je TD(0)?

Najjednoduchší variant používa odmenu a odhad bezprostredne nasledujúceho stavu. TD lambda kombinuje informáciu z viacerých časových vzdialeností.

Je TD learning on-policy alebo off-policy?

Môže byť oboje. SARSA sa učí hodnotu používanej politiky, Q-learning smeruje k chamtivej cieľovej politike.

Ako sa sleduje nestabilita?

Kontrolujú sa TD chyby, rozsah hodnôt, gradienty, citlivosť na seed a výkon oddelene od tréningového replay bufferu.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Sutton, Learning to Predict by the Methods of Temporal Differences, 1988 Sutton a Barto, Reinforcement Learning, 2nd edition

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.