Revize: 1. august 2026

Q-učení

Q-learning je bezmodelový off-policy algoritmus posilovaného učení, který odhaduje optimální akčnou hodnotovou funkci. Po prechode ze stavu s do stavu s2 po akcii a aktualizuje Q(s,a) směrem k súčtu odměny a diskontovaného maxima Q(s2,a2). Cílová politika je chamtivá vůči naučeným hodnotám, i když data může zbierat prieskumná politika. V konečnom Markovovom rozhodovacom procese konverguje za podmínek dostatočného navštívení dvojic stav-akce a vhodne klesajúcich kroků učení.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-01

Odborná definice

Odborná definice

Q-learning je bezmodelový off-policy algoritmus posilovaného učení, který odhaduje optimální akčnou hodnotovou funkci. Po prechode ze stavu s do stavu s2 po akcii a aktualizuje Q(s,a) směrem k súčtu odměny a diskontovaného maxima Q(s2,a2). Cílová politika je chamtivá vůči naučeným hodnotám, i když data může zbierat prieskumná politika. V konečnom Markovovom rozhodovacom procese konverguje za podmínek dostatočného navštívení dvojic stav-akce a vhodne klesajúcich kroků učení.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Skladový robot si při každé križovatke vede skóre možných smerů. Po doručení balíka spetne zvyšuje hodnoty rozhodnutí, které viedli k rychlé trase, a snižuje ty, které priniesli meškání. Nemusí poznat mapu pravděpodobností pohybu předem. Učí se z uskutočnených prechodů. Pokud však vždy zvolí pouze dosud nejlepší směr, neobjaví skratku. Prieskum proto musí zůstat součástí učení, ačkoli výsledná politika může být chamtivá.

Časté otázky

Časté otázky

Proč je Q-learning off-policy?

Aktualizace používá najvyššiu hodnotu další akce, ne nevyhnutelně akci, kterou prieskumná politika skutečně provede.

Jak se liší od SARSA?

SARSA aktualizuje podle nasledujúcej vykonanej akce a učí se hodnotu aktuální politiky. Q-learning směřuje k optimálnej chamtivej politice.

Kdy je zaručená konvergence?

Při konečnom probléme, opakovaném vzorkování všech dvojic a krocích učení splňajúcich štandardné podmínky stochastickej aproximace.

Co se dělá při spojitých stavech?

Q-funkce se aproximuje modelem, například neuronovou sítí. Tím zaniká jednoduchá tabulková záruka a roste riziko nestability.

Co je nadhodnotení Q-hodnot?

Maximum nad hlučnými odhadmi upřednostňuje kladne chybné hodnoty. Double Q-learning oddeluje výběr akce od její hodnocení.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Watkins a Dayan, Q-learning, 1992 Sutton a Barto, Reinforcement Learning, 2nd edition

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.