Optimalizace v reinforcement learningu

Policy gradient

Policy gradient je rodina reinforcement learning algoritmů, které přímo optimalizují parametry diferencovatelnej politiky v smere vyššieho očekávaného výnosu. Gradient se odhaduje ze vzorků trajektorií pomocí logaritmu pravděpodobnosti vykonanej akce násobeného návratom nebo advantage. Metoda dokáže pracovat se stochastickou politikou a spojitým prostorem akcií, ale odhad může mít vysokou varianci. Baseline, critic, advantage estimation, normalizace a omezení velikosti aktualizace zlepšují stabilitu. Data jsou často on-policy, proto bývá sběr skúseností nákladný.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-07

Odborná definice

Odborná definice

Policy gradient je rodina reinforcement learning algoritmů, které přímo optimalizují parametry diferencovatelnej politiky v smere vyššieho očekávaného výnosu. Gradient se odhaduje ze vzorků trajektorií pomocí logaritmu pravděpodobnosti vykonanej akce násobeného návratom nebo advantage. Metoda dokáže pracovat se stochastickou politikou a spojitým prostorem akcií, ale odhad může mít vysokou varianci. Baseline, critic, advantage estimation, normalizace a omezení velikosti aktualizace zlepšují stabilitu. Data jsou často on-policy, proto bývá sběr skúseností nákladný.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Agent zkouší řízení stroja a po každé trajektórii zistí, které rozhodnutí viedli k vyššiemu výsledku. Policy gradient neposúva přímo akci, ale upravuje pravděpodobnost rozhodnutí, které se objavili v úspešných priebehoch. Problém je, že stejná akce může raz pomoci a inokedy ne, proto je signál hlučný. Critic odhaduje, co se dalo očakávat, a politika se učí zejména z rozdílu oproti tomuto očakávání. Při reálném zařízení se explorace omezuje simulací, bezpečnostním filtrom a konzervatívnymi krokmi.

Časté otázky

Časté otázky

Co vyjadřuje advantage v policy gradiente?

Advantage odhaduje, o kolik byla zvolená akce lepší nebo horšia než typický výsledek v daném stave. Snižuje varianci a pomáhá přiřadit kredit konkrétnímu rozhodnutí.

Proč se používá log pravděpodobnosti akce?

Log-derivative trick umožní prepísat gradient očakávání do tvaru, který lze odhadnout ze sampled trajektorií bez diferenciace dynamiky prostředí.

Je REINFORCE policy gradient algoritmus?

Ano. Jde o základnou Monte Carlo metódu, která váží gradient log pravděpodobnosti úplným návratom. Je jednoduchá, ale často má vysokou varianci a slabou dátovou efektívnost.

Jak se policy gradient liší od Q-learningu?

Q-learning se učí hodnotu akcií a politiku odvodí výběrem najlepšej akce. Policy gradient přímo mění parametry politiky a přirozeně podporuje spojité nebo stochastické akce.

Co může způsobit kolaps politiky?

Příliš velký krok, slabý reward, chybná normalizace nebo nepresný critic mohou rychle snížit rozmanitost akcií. Používají se clipping, trust region přístupy, entropy bonus a sledování KL divergence.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Sutton et al., Policy Gradient Theorem
  • OpenAI Spinning Up, Policy Optimization

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.