Trénovanie a optimalizácia · Posilňované učenie

Hodnotová funkcia

Value function

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-04

Odborná definícia

Význam a odborné vymedzenie pojmu

Value function v posilňovanom učení priraďuje stavu alebo dvojici stav a akcia očakávaný kumulatívny diskontovaný výnos pri určitej politike. Stavová hodnota V vyjadruje perspektívu zo stavu, akčná hodnota Q zahŕňa aj zvolenú akciu. Funkcia prepája okamžité odmeny s dlhodobými následkami a môže byť uložená tabuľkovo alebo aproximovaná neurónovou sieťou. Jej presnosť závisí od politiky, dynamiky prostredia, diskontného faktora a distribúcie skúseností. Nie je totožná s reward function.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Odmena hovorí, čo agent získal práve teraz. Hodnotová funkcia odhaduje, čo tento krok pravdepodobne prinesie v celom ďalšom priebehu. V šachu môže byť okamžité získanie pešiaka lákavé, no ak vedie k strate dámy, stav má nízku dlhodobú hodnotu. Agent preto potrebuje číslo, ktoré zhrnie budúce odmeny za daného spôsobu hry. Keď sa prostredie alebo politika zmení, starý odhad sa môže stať nepresným, preto sa hodnoty priebežne aktualizujú z nových prechodov.

Časté otázky

Otázky, ktoré spresňujú význam

Aký je rozdiel medzi V a Q funkciou?

V hodnotí stav pri politike. Q hodnotí konkrétnu akciu v danom stave a potom pokračovanie podľa politiky, preto sa priamo používa pri výbere akcií.

Načo slúži diskontný faktor?

Určuje, akú váhu majú vzdialenejšie odmeny. Hodnota blízka jednej podporuje dlhší horizont, menšia hodnota zvýrazní okamžité výsledky.

Je value function vždy známa presne?

Nie. Pri reálnych úlohách sa odhaduje zo vzoriek a môže trpieť biasom, vysokou varianciou, extrapoláciou mimo dát alebo nestacionaritou.

Ako súvisí hodnotová funkcia s criticom?

V actor-critic metódach critic aproximuje V alebo Q a poskytuje signál pre aktualizáciu politiky. Actor následne mení pravdepodobnosť výberu akcií.

Môže mať vysoká hodnota neželané správanie?

Áno, ak reward function zle reprezentuje cieľ. Hodnotová funkcia potom správne predikuje návratnosť chybnej odmeny, nie spoločenskú alebo obchodnú vhodnosť.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Reinforcement Learning: An Introduction, Sutton and Barto
  • NIST Glossary, reinforcement learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.