Odborná definice
Odborná definice
Policy v reinforcement learningu je pravidlo, které mapuje stav nebo pozorování na akci, případně na pravděpodobnostní rozdělení nad akciami. Deterministická politika vybírá jednu akci, stochastická umožňuje sampling a tím i riadenou exploraci. Politika může být tabulka, strom, neuronová síť nebo kombinace plánování a naučených komponentů. Její kvalita se posuzuje očakávaným kumulatívnym výnosom v definovaném prostředí. Bezpečné nasazení vyžaduje kontrolu omezení, distribučného posunu, čiastočnej pozorovatelnosti a rozdílu mezi simulátorom a realitou.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Robot vidí polohu, rychlost a stav batérie. Politika z těchto informací vybere, zda má pokračovat, spomalit nebo se vrátit k nabíjačke. Pokud vrací pravděpodobnosti, může občas vyskúšat jinou bezpečnou možnost a zbierat zkušenosti. Politika není totožná s cílem, cíl určuje reward a politika je naučený způsob konání. Když je reward navržený špatně, agent může najít skratku, která maximalizuje číslo, ale poškodí reálný proces. Proto se testují i zakázané stavy a núdzové pravidla mimo modelu.
Časté otázky
Časté otázky
Jaký je rozdíl mezi policy a value function?
Policy určuje, co agent udělá. Value function odhaduje budúci výnos ze stavu nebo dvojice stav a akce. Mnohé algoritmy používají obě části současně.
Proč může být policy stochastická?
Náhodnost podporuje exploraci, reprezentuje nejistotu a může zabránit predvídatelnému chování. V bezpečnostne citlivom režime se její rozsah omezuje povoleným prostorem akcií.
Je systémový prompt politikou LLM agenta?
Ne v presnom RL význame. Prompt ovlivňuje chování modelu, ale policy je matematické mapování pozorování na akce. V agentnej aplikaci se tyto vrstvy mohou kombinovat.
Jak se politika hodnotí offline?
Pomocí simulace, historických trajektorií a off-policy evaluace. Výsledek je citlivý na pokrytí dat, protože chování v nepozorovaných stavech nelze spolehlivě odhadnout bez dalších predpokladů.
Co je policy constraint?
Je to podmínka obmedzujúca možné akce nebo riziko, například limit spotreby, zákaz vstupu do zóny nebo pravděpodobnost porušení bezpečnosti. Může být součástí optimalizace nebo externího safety layera.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Sutton and Barto, Reinforcement Learning
- Google ML Glossary, Policy
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
