Odborná definice
Odborná definice
Value function v posilňovanom učení přiřazuje stavu nebo dvojici stav a akce očekávaný kumulatívny diskontovaný výnos při určité politice. Stavová hodnota V vyjadřuje perspektívu ze stavu, akční hodnota Q zahrnuje i zvolenou akci. Funkce propojuje okamžité odměny s dlhodobými následkami a může být uložená tabulkovo nebo aproximovaná neuronovou sítí. Její přesnost závisí na politiky, dynamiky prostředí, diskontného faktora a distribuce skúseností. Není totožná s reward function.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Odměna hovoří, co agent získal právě teraz. Hodnotová funkce odhaduje, co tento krok pravděpodobně prinese v celém dalším průběhu. V šachu může být okamžité získání pešiaka lákavé, ale pokud vede k strate dámy, stav má nízkou dlhodobou hodnotu. Agent proto potřebuje číslo, které shrne budoucí odměny za daného způsobu hry. Když se prostředí nebo politika změní, starý odhad se může stát nepresným, proto se hodnoty průběžně aktualizují z nových prechodů.
Časté otázky
Časté otázky
Jaký je rozdíl mezi V a Q funkcí?
V hodnotí stav při politice. Q hodnotí konkrétní akci v daném stave a potom pokračování podle politiky, proto se přímo používá při výběru akcií.
K čemu slouží diskontný faktor?
Určuje, jakou váhu mají vzdialenejšie odměny. Hodnota blízka jedné podporuje dlhší horizont, menší hodnota zvýrazní okamžité výsledky.
Je value function vždy známa přesně?
Ne. Při reálných úlohách se odhaduje ze vzorků a může trpieť biasom, vysokou variancí, extrapolací mimo dat nebo nestacionaritou.
Jako souvisí hodnotová funkce s criticom?
V actor-critic metódach critic aproximuje V nebo Q a poskytuje signál pro aktualizaci politiky. Actor následně mění pravděpodobnost výběru akcií.
Může mít vysoká hodnota neželané chování?
Ano, pokud reward function špatně reprezentuje cíl. Hodnotová funkce potom správně predikuje návratnost chybnej odměny, ne spoločenskou nebo obchodnou vhodnost.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Reinforcement Learning: An Introduction, Sutton and Barto
- NIST Glossary, reinforcement learning
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
