Trénovanie a optimalizácia · Posilňované učenie a odhad hodnôt

Učenie z časového rozdielu

Temporal-difference learning

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-20

Odborná definícia

Význam a odborné vymedzenie pojmu

Temporal-difference learning, skrátene TD learning, aktualizuje odhad hodnoty zo súčtu okamžitej odmeny a diskontovaného odhadu nasledujúceho stavu. Rozdiel medzi týmto bootstrapovým cieľom a aktuálnym odhadom sa nazýva TD error. Metóda sa môže učiť po každom kroku bez čakania na koniec epizódy a tvorí základ algoritmov SARSA, Q-learning a actor-critic. Pretože cieľ sám závisí od odhadu modelu, kombinácia aproximácie funkcie, off-policy dát a agresívnych aktualizácií môže viesť k nestabilite.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Agent nemusí čakať, kým dokončí celú hru, aby zistil, či bol posledný krok dobrý. Po každom ťahu porovná starý odhad situácie s novou odmenou a s tým, ako nádejne vyzerá ďalší stav. Ak je súčet vyšší, hodnotu zvýši. Ak je nižší, zníži ju. Učí sa teda z prekvapenia medzi dvoma po sebe idúcimi odhadmi. Výhodou je rýchla spätná väzba, nevýhodou možnosť, že chybný budúci odhad sa prenesie do predchádzajúcich stavov.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa TD learning líši od Monte Carlo učenia?

Monte Carlo používa skutočný návrat až po skončení epizódy. TD sa aktualizuje skôr pomocou odhadu ďalšieho stavu.

Čo znamená bootstrapping?

Cieľ aktualizácie obsahuje hodnotu, ktorú systém sám odhadol, namiesto úplne pozorovaného výsledku.

Čo je TD(0)?

Najjednoduchší variant používa odmenu a odhad bezprostredne nasledujúceho stavu. TD lambda kombinuje informáciu z viacerých časových vzdialeností.

Je TD learning on-policy alebo off-policy?

Môže byť oboje. SARSA sa učí hodnotu používanej politiky, Q-learning smeruje k chamtivej cieľovej politike.

Ako sa sleduje nestabilita?

Kontrolujú sa TD chyby, rozsah hodnôt, gradienty, citlivosť na seed a výkon oddelene od tréningového replay bufferu.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Sutton, Learning to Predict by the Methods of Temporal Differences, 1988 Sutton a Barto, Reinforcement Learning, 2nd edition

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.