Revize: 1. august 2026

Neuronová síť aproximující Q-funkci

Q-network je neuronová síť, která aproximuje akčnou hodnotovou funkci. Při diskrétnych akciách často přijímá stav a vrací vektor Q-hodnot pro všechny dostupné akce. Deep Q-Network stabilizuje učení pomocí replay bufferu, cílové sítě a orezání nebo úpravy chyb. Síť generalizuje mezi podobnými stavmi, ale spojuje bootstrapové cíle, korelované data a meniacu se cílovou funkci, co může vyvolat divergenci. Výstupní hodnoty nejsou kalibrované pravděpodobnosti.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-05

Odborná definice

Odborná definice

Q-network je neuronová síť, která aproximuje akčnou hodnotovou funkci. Při diskrétnych akciách často přijímá stav a vrací vektor Q-hodnot pro všechny dostupné akce. Deep Q-Network stabilizuje učení pomocí replay bufferu, cílové sítě a orezání nebo úpravy chyb. Síť generalizuje mezi podobnými stavmi, ale spojuje bootstrapové cíle, korelované data a meniacu se cílovou funkci, co může vyvolat divergenci. Výstupní hodnoty nejsou kalibrované pravděpodobnosti.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při videohre nelze vytvořit tabulku pro každý možný obraz. Q-network se naučí z pixelů rozpoznat situace, které vedou k podobným budoucím odmenám. Starší zkušenosti se miešají v replay buffri, aby po sebe idúce snímky neurčovali každý krok učení. Druhá, pomalšie aktualizovaná síť poskytuje stabilnější cíl. Pokud se cíl mění stejně rychle jako predikce, učení se může naháňat za vlastným šumem.

Časté otázky

Časté otázky

K čemu slouží target network?

Poskytuje dočasne stabilní odhad budoucích Q-hodnot. Aktualizuje se pomalšie nebo periodicky z hlavnej sítě.

Proč se používá experience replay?

Rozbije časovou korelaci vzorků, znovu využívá zkušenosti a umožňuje miešat různé části distribuce.

Je Q-network vhodná pro spojité akce?

Přímý výstup pro každou akci ne. Používají se actor-critic metody nebo špeciálne parametrizace maxima.

Co řeší Double DQN?

Oddeluje výběr najlepšej akce od její hodnocení a snižuje systematické nadhodnocování.

Jak se hodnotí mimo průměrné odměny?

Sleduje se stabilita mezi seedmi, rozsah Q-hodnot, výkon v scenároch, citlivost na perturbace a bezpečnostní omezení.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Mnih et al., Human-level control through deep reinforcement learning, 2015

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.