Revize: 1. august 2026

Akční hodnotová funkce

Q-function je funkce, která každé přípustné dvojici stavu a akce přiřazuje Q-value. Může být reprezentovaná tabulkou, lineárním modelem, stromem nebo neuronovou sítí. Splňuje Bellmanovu rovnici pro zvolenou politiku nebo Bellmanovu optimální rovnici pro Q*. Funkce je globální objekt definovaný nad prostorem stavů a akcií, zatímco Q-value je její hodnota v jednom bodě. Při aproximaci mimo pokrytých dat může vracet přesvědčivé, ale nepodložené odhady.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-03

Odborná definice

Odborná definice

Q-function je funkce, která každé přípustné dvojici stavu a akce přiřazuje Q-value. Může být reprezentovaná tabulkou, lineárním modelem, stromem nebo neuronovou sítí. Splňuje Bellmanovu rovnici pro zvolenou politiku nebo Bellmanovu optimální rovnici pro Q*. Funkce je globální objekt definovaný nad prostorem stavů a akcií, zatímco Q-value je její hodnota v jednom bodě. Při aproximaci mimo pokrytých dat může vracet přesvědčivé, ale nepodložené odhady.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Q-value je jedno číslo při jedné možnosti. Q-function je celý kalkulátor, který také číslo vytvoří pro libovolný stav a akci. V malé hře může mít podobu tabulky. Při robotickém rameni musí odhadovat hodnotu i pro polohy, které přesně nevidělo. Tehdy generalizuje z podobných příkladů. Pokud dostane kombinaci mimo tréninkového rozsahu, kalkulátor může extrapolovat bez varování.

Časté otázky

Časté otázky

Je Q-function vždy optimální?

Ne. Qπ popisuje konkrétní politiku. Optimální funkce Q* dosahuje nejvyšší možný očekávaný návrat.

Co je Bellman residual?

Rozdíl mezi aktuálnou hodnotou funkce a hodnotou danou Bellmanovým cílem. Používá se jako tréninkový nebo diagnostický signál.

Jak se funkce učí z dat?

Minimalizuje se chyba vůči TD cílem, používají se Monte Carlo návraty nebo metody založené na dynamickom programování.

Proč je offline učení náročné?

Model může nadhodnotit akce, které se v datasete téměř nevyskytli. Chybí priama zpětná vazba na opravu extrapolace.

Může Q-function pracovat se spojitou akciou?

Ano, ale nájdení maxima nad spojitým prostorem je náročné. Často se používá samostatná politika nebo strukturovaný model.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Sutton a Barto, Reinforcement Learning, 2nd edition

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.