Trénovanie a optimalizácia · Posilňované učenie

Akčná hodnotová funkcia

Q-function

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-03

Odborná definícia

Význam a odborné vymedzenie pojmu

Q-function je funkcia, ktorá každej prípustnej dvojici stavu a akcie priraďuje Q-value. Môže byť reprezentovaná tabuľkou, lineárnym modelom, stromom alebo neurónovou sieťou. Spĺňa Bellmanovu rovnicu pre zvolenú politiku alebo Bellmanovu optimálnu rovnicu pre Q*. Funkcia je globálny objekt definovaný nad priestorom stavov a akcií, kým Q-value je jej hodnota v jednom bode. Pri aproximácii mimo pokrytých dát môže vracať presvedčivé, ale nepodložené odhady.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Q-value je jedno číslo pri jednej možnosti. Q-function je celý kalkulátor, ktorý také číslo vytvorí pre ľubovoľný stav a akciu. V malej hre môže mať podobu tabuľky. Pri robotickom ramene musí odhadovať hodnotu aj pre polohy, ktoré presne nevidelo. Vtedy generalizuje z podobných príkladov. Ak dostane kombináciu mimo tréningového rozsahu, kalkulátor môže extrapolovať bez varovania.

Časté otázky

Otázky, ktoré spresňujú význam

Je Q-function vždy optimálna?

Nie. Qπ opisuje konkrétnu politiku. Optimálna funkcia Q* dosahuje najvyšší možný očakávaný návrat.

Čo je Bellman residual?

Rozdiel medzi aktuálnou hodnotou funkcie a hodnotou danou Bellmanovým cieľom. Používa sa ako tréningový alebo diagnostický signál.

Ako sa funkcia učí z dát?

Minimalizuje sa chyba voči TD cieľom, používajú sa Monte Carlo návraty alebo metódy založené na dynamickom programovaní.

Prečo je offline učenie náročné?

Model môže nadhodnotiť akcie, ktoré sa v datasete takmer nevyskytli. Chýba priama spätná väzba na opravu extrapolácie.

Môže Q-function pracovať so spojitou akciou?

Áno, ale nájdenie maxima nad spojitým priestorom je náročné. Často sa používa samostatná politika alebo štruktúrovaný model.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Sutton a Barto, Reinforcement Learning, 2nd edition

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.