Sekvenční rozhodování a agenti

Posilované učení

Reinforcement learning, RL, je rámec učení politiky, ve kterém agent volí akce v stave nebo pozorování prostředí a dostává odměnu spolu s novým stavem. Cílem je maximalizovat očekávaný kumulatívny diskontovaný výnos, ne okamžitou odměnu jednoho kroku. Úloha se často formalizuje jako Markovů rozhodovací proces. Metody mohou být model-free nebo model-based, on-policy nebo off-policy. Klíčové problémy zahrnují exploration, oneskorenou zásluhu, vzorkovou náročnost, bezpečné omezení a neúplnost reward funkce.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-12

Odborná definice

Odborná definice

Reinforcement learning, RL, je rámec učení politiky, ve kterém agent volí akce v stave nebo pozorování prostředí a dostává odměnu spolu s novým stavem. Cílem je maximalizovat očekávaný kumulatívny diskontovaný výnos, ne okamžitou odměnu jednoho kroku. Úloha se často formalizuje jako Markovů rozhodovací proces. Metody mohou být model-free nebo model-based, on-policy nebo off-policy. Klíčové problémy zahrnují exploration, oneskorenou zásluhu, vzorkovou náročnost, bezpečné omezení a neúplnost reward funkce.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Agent se neučí z hotového seznamu správných odpovědí. Zkouší rozhodnutí, sleduje následky a postupně mění strategii tak, aby získal více dlhodobej odměny. V hře může obetovat krátkodobý bod, pokud tím zvýší šancu na výhru. V reálném provozu je však skúšání drahé nebo nebezpečné a špatně navržená odměna může podporit nežádoucí chování. Proto se RL často trénuje v simulaci, z historických dat nebo s bezpečnostními obmedzeniami a ludským dohladom.

Časté otázky

Časté otázky

Jak se RL liší od supervised learning?

Supervised learning dostává cílový výstup pro jednotlivé příklady. RL dostává hodnocení důsledků akcií, často oneskorene, a jeho rozhodnutí mění budoucí data.

Co je exploration a exploitation?

Exploration zkouší méně známé akce, aby získal informaci. Exploitation používá aktuálně najlepšiu politiku. Příliš mnoho jednoho nebo druhého snižuje dlouhodobý výkon.

Proč je návrh odměny kritický?

Odměna je optimalizační signál, ne úplný popis lidského záměru. Agent může najít skratku, která zvyšuje skóre a zároveň porušuje účel úlohy.

Co je offline reinforcement learning?

Politika se učí z pevného datasetu historických prechodů bez dalšího skúšání v prostředí. Rizikem je hodnocení akcií, které v datech téměř neboli.

Jak se RL nasadzuje bezpečně?

Používají se simulace, konzervatívne politiky, omezení akcií, human approval, monitoring, rollback a postupné testování s malým dosahom.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Sutton and Barto, Reinforcement Learning: An Introduction

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.