Posilované učení

hodnotová funkce

Value function v posilňovanom učení přiřazuje stavu nebo dvojici stav a akce očekávaný kumulatívny diskontovaný výnos při určité politice. Stavová hodnota V vyjadřuje perspektívu ze stavu, akční hodnota Q zahrnuje i zvolenou akci. Funkce propojuje okamžité odměny s dlhodobými následkami a může být uložená tabulkovo nebo aproximovaná neuronovou sítí. Její přesnost závisí na politiky, dynamiky prostředí, diskontného faktora a distribuce skúseností. Není totožná s reward function.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-04

Odborná definice

Odborná definice

Value function v posilňovanom učení přiřazuje stavu nebo dvojici stav a akce očekávaný kumulatívny diskontovaný výnos při určité politice. Stavová hodnota V vyjadřuje perspektívu ze stavu, akční hodnota Q zahrnuje i zvolenou akci. Funkce propojuje okamžité odměny s dlhodobými následkami a může být uložená tabulkovo nebo aproximovaná neuronovou sítí. Její přesnost závisí na politiky, dynamiky prostředí, diskontného faktora a distribuce skúseností. Není totožná s reward function.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Odměna hovoří, co agent získal právě teraz. Hodnotová funkce odhaduje, co tento krok pravděpodobně prinese v celém dalším průběhu. V šachu může být okamžité získání pešiaka lákavé, ale pokud vede k strate dámy, stav má nízkou dlhodobou hodnotu. Agent proto potřebuje číslo, které shrne budoucí odměny za daného způsobu hry. Když se prostředí nebo politika změní, starý odhad se může stát nepresným, proto se hodnoty průběžně aktualizují z nových prechodů.

Časté otázky

Časté otázky

Jaký je rozdíl mezi V a Q funkcí?

V hodnotí stav při politice. Q hodnotí konkrétní akci v daném stave a potom pokračování podle politiky, proto se přímo používá při výběru akcií.

K čemu slouží diskontný faktor?

Určuje, jakou váhu mají vzdialenejšie odměny. Hodnota blízka jedné podporuje dlhší horizont, menší hodnota zvýrazní okamžité výsledky.

Je value function vždy známa přesně?

Ne. Při reálných úlohách se odhaduje ze vzorků a může trpieť biasom, vysokou variancí, extrapolací mimo dat nebo nestacionaritou.

Jako souvisí hodnotová funkce s criticom?

V actor-critic metódach critic aproximuje V nebo Q a poskytuje signál pro aktualizaci politiky. Actor následně mění pravděpodobnost výběru akcií.

Může mít vysoká hodnota neželané chování?

Ano, pokud reward function špatně reprezentuje cíl. Hodnotová funkce potom správně predikuje návratnost chybnej odměny, ne spoločenskou nebo obchodnou vhodnost.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Reinforcement Learning: An Introduction, Sutton and Barto
  • NIST Glossary, reinforcement learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.