Odborná definice
Odborná definice
Q-network je neuronová síť, která aproximuje akčnou hodnotovou funkci. Při diskrétnych akciách často přijímá stav a vrací vektor Q-hodnot pro všechny dostupné akce. Deep Q-Network stabilizuje učení pomocí replay bufferu, cílové sítě a orezání nebo úpravy chyb. Síť generalizuje mezi podobnými stavmi, ale spojuje bootstrapové cíle, korelované data a meniacu se cílovou funkci, co může vyvolat divergenci. Výstupní hodnoty nejsou kalibrované pravděpodobnosti.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Při videohre nelze vytvořit tabulku pro každý možný obraz. Q-network se naučí z pixelů rozpoznat situace, které vedou k podobným budoucím odmenám. Starší zkušenosti se miešají v replay buffri, aby po sebe idúce snímky neurčovali každý krok učení. Druhá, pomalšie aktualizovaná síť poskytuje stabilnější cíl. Pokud se cíl mění stejně rychle jako predikce, učení se může naháňat za vlastným šumem.
Časté otázky
Časté otázky
K čemu slouží target network?
Poskytuje dočasne stabilní odhad budoucích Q-hodnot. Aktualizuje se pomalšie nebo periodicky z hlavnej sítě.
Proč se používá experience replay?
Rozbije časovou korelaci vzorků, znovu využívá zkušenosti a umožňuje miešat různé části distribuce.
Je Q-network vhodná pro spojité akce?
Přímý výstup pro každou akci ne. Používají se actor-critic metody nebo špeciálne parametrizace maxima.
Co řeší Double DQN?
Oddeluje výběr najlepšej akce od její hodnocení a snižuje systematické nadhodnocování.
Jak se hodnotí mimo průměrné odměny?
Sleduje se stabilita mezi seedmi, rozsah Q-hodnot, výkon v scenároch, citlivost na perturbace a bezpečnostní omezení.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Mnih et al., Human-level control through deep reinforcement learning, 2015
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
