Reinforcement learning a rozhodování

Policy

Policy v reinforcement learningu je pravidlo, které mapuje stav nebo pozorování na akci, případně na pravděpodobnostní rozdělení nad akciami. Deterministická politika vybírá jednu akci, stochastická umožňuje sampling a tím i riadenou exploraci. Politika může být tabulka, strom, neuronová síť nebo kombinace plánování a naučených komponentů. Její kvalita se posuzuje očakávaným kumulatívnym výnosom v definovaném prostředí. Bezpečné nasazení vyžaduje kontrolu omezení, distribučného posunu, čiastočnej pozorovatelnosti a rozdílu mezi simulátorom a realitou.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-06

Odborná definice

Odborná definice

Policy v reinforcement learningu je pravidlo, které mapuje stav nebo pozorování na akci, případně na pravděpodobnostní rozdělení nad akciami. Deterministická politika vybírá jednu akci, stochastická umožňuje sampling a tím i riadenou exploraci. Politika může být tabulka, strom, neuronová síť nebo kombinace plánování a naučených komponentů. Její kvalita se posuzuje očakávaným kumulatívnym výnosom v definovaném prostředí. Bezpečné nasazení vyžaduje kontrolu omezení, distribučného posunu, čiastočnej pozorovatelnosti a rozdílu mezi simulátorom a realitou.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Robot vidí polohu, rychlost a stav batérie. Politika z těchto informací vybere, zda má pokračovat, spomalit nebo se vrátit k nabíjačke. Pokud vrací pravděpodobnosti, může občas vyskúšat jinou bezpečnou možnost a zbierat zkušenosti. Politika není totožná s cílem, cíl určuje reward a politika je naučený způsob konání. Když je reward navržený špatně, agent může najít skratku, která maximalizuje číslo, ale poškodí reálný proces. Proto se testují i zakázané stavy a núdzové pravidla mimo modelu.

Časté otázky

Časté otázky

Jaký je rozdíl mezi policy a value function?

Policy určuje, co agent udělá. Value function odhaduje budúci výnos ze stavu nebo dvojice stav a akce. Mnohé algoritmy používají obě části současně.

Proč může být policy stochastická?

Náhodnost podporuje exploraci, reprezentuje nejistotu a může zabránit predvídatelnému chování. V bezpečnostne citlivom režime se její rozsah omezuje povoleným prostorem akcií.

Je systémový prompt politikou LLM agenta?

Ne v presnom RL význame. Prompt ovlivňuje chování modelu, ale policy je matematické mapování pozorování na akce. V agentnej aplikaci se tyto vrstvy mohou kombinovat.

Jak se politika hodnotí offline?

Pomocí simulace, historických trajektorií a off-policy evaluace. Výsledek je citlivý na pokrytí dat, protože chování v nepozorovaných stavech nelze spolehlivě odhadnout bez dalších predpokladů.

Co je policy constraint?

Je to podmínka obmedzujúca možné akce nebo riziko, například limit spotreby, zákaz vstupu do zóny nebo pravděpodobnost porušení bezpečnosti. Může být součástí optimalizace nebo externího safety layera.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Sutton and Barto, Reinforcement Learning
  • Google ML Glossary, Policy

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.