Odborná definícia
Význam a odborné vymedzenie pojmu
Q-learning je bezmodelový off-policy algoritmus posilňovaného učenia, ktorý odhaduje optimálnu akčnú hodnotovú funkciu. Po prechode zo stavu s do stavu s2 po akcii a aktualizuje Q(s,a) smerom k súčtu odmeny a diskontovaného maxima Q(s2,a2). Cieľová politika je chamtivá voči naučeným hodnotám, aj keď dáta môže zbierať prieskumná politika. V konečnom Markovovom rozhodovacom procese konverguje za podmienok dostatočného navštívenia dvojíc stav-akcia a vhodne klesajúcich krokov učenia.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Skladový robot si pri každej križovatke vedie skóre možných smerov. Po doručení balíka spätne zvyšuje hodnoty rozhodnutí, ktoré viedli k rýchlej trase, a znižuje tie, ktoré priniesli meškanie. Nemusí poznať mapu pravdepodobností pohybu vopred. Učí sa z uskutočnených prechodov. Ak však vždy zvolí iba doteraz najlepší smer, neobjaví skratku. Prieskum preto musí zostať súčasťou učenia, hoci výsledná politika môže byť chamtivá.
Časté otázky
Otázky, ktoré spresňujú význam
Prečo je Q-learning off-policy?
Aktualizácia používa najvyššiu hodnotu ďalšej akcie, nie nevyhnutne akciu, ktorú prieskumná politika skutočne vykoná.
Ako sa líši od SARSA?
SARSA aktualizuje podľa nasledujúcej vykonanej akcie a učí sa hodnotu aktuálnej politiky. Q-learning smeruje k optimálnej chamtivej politike.
Kedy je zaručená konvergencia?
Pri konečnom probléme, opakovanom vzorkovaní všetkých dvojíc a krokoch učenia spĺňajúcich štandardné podmienky stochastickej aproximácie.
Čo sa robí pri spojitých stavoch?
Q-funkcia sa aproximuje modelom, napríklad neurónovou sieťou. Tým zaniká jednoduchá tabuľková záruka a rastie riziko nestability.
Čo je nadhodnotenie Q-hodnôt?
Maximum nad hlučnými odhadmi uprednostňuje kladne chybné hodnoty. Double Q-learning oddeľuje výber akcie od jej hodnotenia.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Watkins a Dayan, Q-learning, 1992 Sutton a Barto, Reinforcement Learning, 2nd edition
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
