Odborná definícia
Význam a odborné vymedzenie pojmu
Policy gradient je rodina reinforcement learning algoritmov, ktoré priamo optimalizujú parametre diferencovateľnej politiky v smere vyššieho očakávaného výnosu. Gradient sa odhaduje zo vzoriek trajektórií pomocou logaritmu pravdepodobnosti vykonanej akcie násobeného návratom alebo advantage. Metóda dokáže pracovať so stochastickou politikou a spojitým priestorom akcií, no odhad môže mať vysokú varianciu. Baseline, critic, advantage estimation, normalizácia a obmedzenie veľkosti aktualizácie zlepšujú stabilitu. Dáta sú často on-policy, preto býva zber skúseností nákladný.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Agent skúša riadenie stroja a po každej trajektórii zistí, ktoré rozhodnutia viedli k vyššiemu výsledku. Policy gradient neposúva priamo akciu, ale upravuje pravdepodobnosť rozhodnutí, ktoré sa objavili v úspešných priebehoch. Problém je, že rovnaká akcia môže raz pomôcť a inokedy nie, preto je signál hlučný. Critic odhaduje, čo sa dalo očakávať, a politika sa učí najmä z rozdielu oproti tomuto očakávaniu. Pri reálnom zariadení sa explorácia obmedzuje simuláciou, bezpečnostným filtrom a konzervatívnymi krokmi.
Časté otázky
Otázky, ktoré spresňujú význam
Čo vyjadruje advantage v policy gradiente?
Advantage odhaduje, o koľko bola zvolená akcia lepšia alebo horšia než typický výsledok v danom stave. Znižuje varianciu a pomáha priradiť kredit konkrétnemu rozhodnutiu.
Prečo sa používa log pravdepodobnosti akcie?
Log-derivative trick umožní prepísať gradient očakávania do tvaru, ktorý možno odhadnúť zo sampled trajektórií bez diferenciácie dynamiky prostredia.
Je REINFORCE policy gradient algoritmus?
Áno. Ide o základnú Monte Carlo metódu, ktorá váži gradient log pravdepodobnosti úplným návratom. Je jednoduchá, ale často má vysokú varianciu a slabú dátovú efektívnosť.
Ako sa policy gradient líši od Q-learningu?
Q-learning sa učí hodnotu akcií a politiku odvodí výberom najlepšej akcie. Policy gradient priamo mení parametre politiky a prirodzene podporuje spojité alebo stochastické akcie.
Čo môže spôsobiť kolaps politiky?
Príliš veľký krok, slabý reward, chybná normalizácia alebo nepresný critic môžu rýchlo znížiť rozmanitosť akcií. Používajú sa clipping, trust region prístupy, entropy bonus a sledovanie KL divergencie.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Sutton et al., Policy Gradient Theorem
- OpenAI Spinning Up, Policy Optimization
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
