Odborná definícia
Význam a odborné vymedzenie pojmu
Reinforcement learning, RL, je rámec učenia politiky, v ktorom agent volí akcie v stave alebo pozorovaní prostredia a dostáva odmenu spolu s novým stavom. Cieľom je maximalizovať očakávaný kumulatívny diskontovaný výnos, nie okamžitú odmenu jedného kroku. Úloha sa často formalizuje ako Markovov rozhodovací proces. Metódy môžu byť model-free alebo model-based, on-policy alebo off-policy. Kľúčové problémy zahŕňajú exploration, oneskorenú zásluhu, vzorkovú náročnosť, bezpečné obmedzenia a neúplnosť reward funkcie.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Agent sa neučí z hotového zoznamu správnych odpovedí. Skúša rozhodnutia, sleduje následky a postupne mení stratégiu tak, aby získal viac dlhodobej odmeny. V hre môže obetovať krátkodobý bod, ak tým zvýši šancu na výhru. V reálnej prevádzke je však skúšanie drahé alebo nebezpečné a zle navrhnutá odmena môže podporiť nežiaduce správanie. Preto sa RL často trénuje v simulácii, z historických dát alebo s bezpečnostnými obmedzeniami a ľudským dohľadom.
Časté otázky
Otázky, ktoré spresňujú význam
Ako sa RL líši od supervised learning?
Supervised learning dostáva cieľový výstup pre jednotlivé príklady. RL dostáva hodnotenie dôsledkov akcií, často oneskorene, a jeho rozhodnutia menia budúce dáta.
Čo je exploration a exploitation?
Exploration skúša menej známe akcie, aby získal informáciu. Exploitation používa aktuálne najlepšiu politiku. Príliš veľa jedného alebo druhého znižuje dlhodobý výkon.
Prečo je návrh odmeny kritický?
Odmena je optimalizačný signál, nie úplný opis ľudského zámeru. Agent môže nájsť skratku, ktorá zvyšuje skóre a zároveň porušuje účel úlohy.
Čo je offline reinforcement learning?
Politika sa učí z pevného datasetu historických prechodov bez ďalšieho skúšania v prostredí. Rizikom je hodnotenie akcií, ktoré v dátach takmer neboli.
Ako sa RL nasadzuje bezpečne?
Používajú sa simulácie, konzervatívne politiky, obmedzenia akcií, human approval, monitoring, rollback a postupné testovanie s malým dosahom.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Sutton and Barto, Reinforcement Learning: An Introduction
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
