Trénovanie a optimalizácia · Sekvenčné rozhodovanie a agenti

Posilňované učenie

Reinforcement learning

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-12

Odborná definícia

Význam a odborné vymedzenie pojmu

Reinforcement learning, RL, je rámec učenia politiky, v ktorom agent volí akcie v stave alebo pozorovaní prostredia a dostáva odmenu spolu s novým stavom. Cieľom je maximalizovať očakávaný kumulatívny diskontovaný výnos, nie okamžitú odmenu jedného kroku. Úloha sa často formalizuje ako Markovov rozhodovací proces. Metódy môžu byť model-free alebo model-based, on-policy alebo off-policy. Kľúčové problémy zahŕňajú exploration, oneskorenú zásluhu, vzorkovú náročnosť, bezpečné obmedzenia a neúplnosť reward funkcie.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Agent sa neučí z hotového zoznamu správnych odpovedí. Skúša rozhodnutia, sleduje následky a postupne mení stratégiu tak, aby získal viac dlhodobej odmeny. V hre môže obetovať krátkodobý bod, ak tým zvýši šancu na výhru. V reálnej prevádzke je však skúšanie drahé alebo nebezpečné a zle navrhnutá odmena môže podporiť nežiaduce správanie. Preto sa RL často trénuje v simulácii, z historických dát alebo s bezpečnostnými obmedzeniami a ľudským dohľadom.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa RL líši od supervised learning?

Supervised learning dostáva cieľový výstup pre jednotlivé príklady. RL dostáva hodnotenie dôsledkov akcií, často oneskorene, a jeho rozhodnutia menia budúce dáta.

Čo je exploration a exploitation?

Exploration skúša menej známe akcie, aby získal informáciu. Exploitation používa aktuálne najlepšiu politiku. Príliš veľa jedného alebo druhého znižuje dlhodobý výkon.

Prečo je návrh odmeny kritický?

Odmena je optimalizačný signál, nie úplný opis ľudského zámeru. Agent môže nájsť skratku, ktorá zvyšuje skóre a zároveň porušuje účel úlohy.

Čo je offline reinforcement learning?

Politika sa učí z pevného datasetu historických prechodov bez ďalšieho skúšania v prostredí. Rizikom je hodnotenie akcií, ktoré v dátach takmer neboli.

Ako sa RL nasadzuje bezpečne?

Používajú sa simulácie, konzervatívne politiky, obmedzenia akcií, human approval, monitoring, rollback a postupné testovanie s malým dosahom.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Sutton and Barto, Reinforcement Learning: An Introduction

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.