Trénovanie a optimalizácia · Hlboké posilňované učenie

Neurónová sieť aproximujúca Q-funkciu

Q-network

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-05

Odborná definícia

Význam a odborné vymedzenie pojmu

Q-network je neurónová sieť, ktorá aproximuje akčnú hodnotovú funkciu. Pri diskrétnych akciách často prijíma stav a vracia vektor Q-hodnôt pre všetky dostupné akcie. Deep Q-Network stabilizuje učenie pomocou replay bufferu, cieľovej siete a orezania alebo úpravy chýb. Sieť generalizuje medzi podobnými stavmi, ale spája bootstrapové ciele, korelované dáta a meniacu sa cieľovú funkciu, čo môže vyvolať divergenciu. Výstupné hodnoty nie sú kalibrované pravdepodobnosti.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Pri videohre nemožno vytvoriť tabuľku pre každý možný obraz. Q-network sa naučí z pixelov rozpoznať situácie, ktoré vedú k podobným budúcim odmenám. Staršie skúsenosti sa miešajú v replay buffri, aby po sebe idúce snímky neurčovali každý krok učenia. Druhá, pomalšie aktualizovaná sieť poskytuje stabilnejší cieľ. Ak sa cieľ mení rovnako rýchlo ako predikcia, učenie sa môže naháňať za vlastným šumom.

Časté otázky

Otázky, ktoré spresňujú význam

Načo slúži target network?

Poskytuje dočasne stabilný odhad budúcich Q-hodnôt. Aktualizuje sa pomalšie alebo periodicky z hlavnej siete.

Prečo sa používa experience replay?

Rozbije časovú koreláciu vzoriek, znovu využíva skúsenosti a umožňuje miešať rôzne časti distribúcie.

Je Q-network vhodná pre spojité akcie?

Priamy výstup pre každú akciu nie. Používajú sa actor-critic metódy alebo špeciálne parametrizácie maxima.

Čo rieši Double DQN?

Oddeľuje výber najlepšej akcie od jej hodnotenia a znižuje systematické nadhodnocovanie.

Ako sa hodnotí mimo priemernej odmeny?

Sleduje sa stabilita medzi seedmi, rozsah Q-hodnôt, výkon v scenároch, citlivosť na perturbácie a bezpečnostné obmedzenia.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Mnih et al., Human-level control through deep reinforcement learning, 2015

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.