Trénovanie a optimalizácia · Posilňované učenie

Q-učenie

Q-learning

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-01

Odborná definícia

Význam a odborné vymedzenie pojmu

Q-learning je bezmodelový off-policy algoritmus posilňovaného učenia, ktorý odhaduje optimálnu akčnú hodnotovú funkciu. Po prechode zo stavu s do stavu s2 po akcii a aktualizuje Q(s,a) smerom k súčtu odmeny a diskontovaného maxima Q(s2,a2). Cieľová politika je chamtivá voči naučeným hodnotám, aj keď dáta môže zbierať prieskumná politika. V konečnom Markovovom rozhodovacom procese konverguje za podmienok dostatočného navštívenia dvojíc stav-akcia a vhodne klesajúcich krokov učenia.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Skladový robot si pri každej križovatke vedie skóre možných smerov. Po doručení balíka spätne zvyšuje hodnoty rozhodnutí, ktoré viedli k rýchlej trase, a znižuje tie, ktoré priniesli meškanie. Nemusí poznať mapu pravdepodobností pohybu vopred. Učí sa z uskutočnených prechodov. Ak však vždy zvolí iba doteraz najlepší smer, neobjaví skratku. Prieskum preto musí zostať súčasťou učenia, hoci výsledná politika môže byť chamtivá.

Časté otázky

Otázky, ktoré spresňujú význam

Prečo je Q-learning off-policy?

Aktualizácia používa najvyššiu hodnotu ďalšej akcie, nie nevyhnutne akciu, ktorú prieskumná politika skutočne vykoná.

Ako sa líši od SARSA?

SARSA aktualizuje podľa nasledujúcej vykonanej akcie a učí sa hodnotu aktuálnej politiky. Q-learning smeruje k optimálnej chamtivej politike.

Kedy je zaručená konvergencia?

Pri konečnom probléme, opakovanom vzorkovaní všetkých dvojíc a krokoch učenia spĺňajúcich štandardné podmienky stochastickej aproximácie.

Čo sa robí pri spojitých stavoch?

Q-funkcia sa aproximuje modelom, napríklad neurónovou sieťou. Tým zaniká jednoduchá tabuľková záruka a rastie riziko nestability.

Čo je nadhodnotenie Q-hodnôt?

Maximum nad hlučnými odhadmi uprednostňuje kladne chybné hodnoty. Double Q-learning oddeľuje výber akcie od jej hodnotenia.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Watkins a Dayan, Q-learning, 1992 Sutton a Barto, Reinforcement Learning, 2nd edition

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.