Trénování a optimalizace · Revize: 1. august 2026

Q-učení

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-01

Odborná definice

Význam a odborné vymezení pojmu

Q-learning je bezmodelový off-policy algoritmus posilovaného učení, který odhaduje optimální akčnou hodnotovou funkci. Po prechode ze stavu s do stavu s2 po akcii a aktualizuje Q(s,a) směrem k súčtu odměny a diskontovaného maxima Q(s2,a2). Cílová politika je chamtivá vůči naučeným hodnotám, i když data může zbierat prieskumná politika. V konečnom Markovovom rozhodovacom procese konverguje za podmínek dostatočného navštívení dvojic stav-akce a vhodne klesajúcich kroků učení.

Srozumitelné vysvětlení

Jak se pojem používá v praxi

Skladový robot si při každé križovatke vede skóre možných smerů. Po doručení balíka spetne zvyšuje hodnoty rozhodnutí, které viedli k rychlé trase, a snižuje ty, které priniesli meškání. Nemusí poznat mapu pravděpodobností pohybu předem. Učí se z uskutočnených prechodů. Pokud však vždy zvolí pouze dosud nejlepší směr, neobjaví skratku. Prieskum proto musí zůstat součástí učení, ačkoli výsledná politika může být chamtivá.

Časté otázky

Otázky, které upřesňují význam

Proč je Q-learning off-policy?

Aktualizace používá najvyššiu hodnotu další akce, ne nevyhnutelně akci, kterou prieskumná politika skutečně provede.

Jak se liší od SARSA?

SARSA aktualizuje podle nasledujúcej vykonanej akce a učí se hodnotu aktuální politiky. Q-learning směřuje k optimálnej chamtivej politice.

Kdy je zaručená konvergence?

Při konečnom probléme, opakovaném vzorkování všech dvojic a krocích učení splňajúcich štandardné podmínky stochastickej aproximace.

Co se dělá při spojitých stavech?

Q-funkce se aproximuje modelem, například neuronovou sítí. Tím zaniká jednoduchá tabulková záruka a roste riziko nestability.

Co je nadhodnotení Q-hodnot?

Maximum nad hlučnými odhadmi upřednostňuje kladne chybné hodnoty. Double Q-learning oddeluje výběr akce od její hodnocení.

Související pojmy

Významové a tematické souvislosti

Zdroje a redakční stopa

Použitá východiska a odborná revize

  • Watkins a Dayan, Q-learning, 1992 Sutton a Barto, Reinforcement Learning, 2nd edition

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.