Trénovanie a optimalizácia · Optimalizácia v reinforcement learningu

Gradient politiky

Policy gradient

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-07

Odborná definícia

Význam a odborné vymedzenie pojmu

Policy gradient je rodina reinforcement learning algoritmov, ktoré priamo optimalizujú parametre diferencovateľnej politiky v smere vyššieho očakávaného výnosu. Gradient sa odhaduje zo vzoriek trajektórií pomocou logaritmu pravdepodobnosti vykonanej akcie násobeného návratom alebo advantage. Metóda dokáže pracovať so stochastickou politikou a spojitým priestorom akcií, no odhad môže mať vysokú varianciu. Baseline, critic, advantage estimation, normalizácia a obmedzenie veľkosti aktualizácie zlepšujú stabilitu. Dáta sú často on-policy, preto býva zber skúseností nákladný.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Agent skúša riadenie stroja a po každej trajektórii zistí, ktoré rozhodnutia viedli k vyššiemu výsledku. Policy gradient neposúva priamo akciu, ale upravuje pravdepodobnosť rozhodnutí, ktoré sa objavili v úspešných priebehoch. Problém je, že rovnaká akcia môže raz pomôcť a inokedy nie, preto je signál hlučný. Critic odhaduje, čo sa dalo očakávať, a politika sa učí najmä z rozdielu oproti tomuto očakávaniu. Pri reálnom zariadení sa explorácia obmedzuje simuláciou, bezpečnostným filtrom a konzervatívnymi krokmi.

Časté otázky

Otázky, ktoré spresňujú význam

Čo vyjadruje advantage v policy gradiente?

Advantage odhaduje, o koľko bola zvolená akcia lepšia alebo horšia než typický výsledok v danom stave. Znižuje varianciu a pomáha priradiť kredit konkrétnemu rozhodnutiu.

Prečo sa používa log pravdepodobnosti akcie?

Log-derivative trick umožní prepísať gradient očakávania do tvaru, ktorý možno odhadnúť zo sampled trajektórií bez diferenciácie dynamiky prostredia.

Je REINFORCE policy gradient algoritmus?

Áno. Ide o základnú Monte Carlo metódu, ktorá váži gradient log pravdepodobnosti úplným návratom. Je jednoduchá, ale často má vysokú varianciu a slabú dátovú efektívnosť.

Ako sa policy gradient líši od Q-learningu?

Q-learning sa učí hodnotu akcií a politiku odvodí výberom najlepšej akcie. Policy gradient priamo mení parametre politiky a prirodzene podporuje spojité alebo stochastické akcie.

Čo môže spôsobiť kolaps politiky?

Príliš veľký krok, slabý reward, chybná normalizácia alebo nepresný critic môžu rýchlo znížiť rozmanitosť akcií. Používajú sa clipping, trust region prístupy, entropy bonus a sledovanie KL divergencie.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Sutton et al., Policy Gradient Theorem
  • OpenAI Spinning Up, Policy Optimization

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.