Trénování a optimalizace · Optimalizace v reinforcement learningu

Policy gradient

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-07

Odborná definice

Význam a odborné vymezení pojmu

Policy gradient je rodina reinforcement learning algoritmů, které přímo optimalizují parametry diferencovatelnej politiky v smere vyššieho očekávaného výnosu. Gradient se odhaduje ze vzorků trajektorií pomocí logaritmu pravděpodobnosti vykonanej akce násobeného návratom nebo advantage. Metoda dokáže pracovat se stochastickou politikou a spojitým prostorem akcií, ale odhad může mít vysokou varianci. Baseline, critic, advantage estimation, normalizace a omezení velikosti aktualizace zlepšují stabilitu. Data jsou často on-policy, proto bývá sběr skúseností nákladný.

Srozumitelné vysvětlení

Jak se pojem používá v praxi

Agent zkouší řízení stroja a po každé trajektórii zistí, které rozhodnutí viedli k vyššiemu výsledku. Policy gradient neposúva přímo akci, ale upravuje pravděpodobnost rozhodnutí, které se objavili v úspešných priebehoch. Problém je, že stejná akce může raz pomoci a inokedy ne, proto je signál hlučný. Critic odhaduje, co se dalo očakávat, a politika se učí zejména z rozdílu oproti tomuto očakávání. Při reálném zařízení se explorace omezuje simulací, bezpečnostním filtrom a konzervatívnymi krokmi.

Časté otázky

Otázky, které upřesňují význam

Co vyjadřuje advantage v policy gradiente?

Advantage odhaduje, o kolik byla zvolená akce lepší nebo horšia než typický výsledek v daném stave. Snižuje varianci a pomáhá přiřadit kredit konkrétnímu rozhodnutí.

Proč se používá log pravděpodobnosti akce?

Log-derivative trick umožní prepísat gradient očakávání do tvaru, který lze odhadnout ze sampled trajektorií bez diferenciace dynamiky prostředí.

Je REINFORCE policy gradient algoritmus?

Ano. Jde o základnou Monte Carlo metódu, která váží gradient log pravděpodobnosti úplným návratom. Je jednoduchá, ale často má vysokou varianci a slabou dátovou efektívnost.

Jak se policy gradient liší od Q-learningu?

Q-learning se učí hodnotu akcií a politiku odvodí výběrem najlepšej akce. Policy gradient přímo mění parametry politiky a přirozeně podporuje spojité nebo stochastické akce.

Co může způsobit kolaps politiky?

Příliš velký krok, slabý reward, chybná normalizace nebo nepresný critic mohou rychle snížit rozmanitost akcií. Používají se clipping, trust region přístupy, entropy bonus a sledování KL divergence.

Související pojmy

Významové a tematické souvislosti

Zdroje a redakční stopa

Použitá východiska a odborná revize

  • Sutton et al., Policy Gradient Theorem
  • OpenAI Spinning Up, Policy Optimization

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.