Sekvenčné rozhodovanie z historických dát

Offline reinforcement learning

Offline posilňované učenie

Offline reinforcement learning je paradigma, v ktorej sa politika učí výlučne z pevného datasetu minulých prechodov medzi stavmi, akciami a odmenami bez ďalšej interakcie s prostredím počas tréningu. Hlavným problémom je distribučný posun, pretože politika môže vybrať akcie slabo alebo vôbec nepokryté dátami a hodnotová funkcia im priradí neodôvodnene vysoký úžitok. Algoritmy preto obmedzujú politiku k správaniu v datasete, používajú konzervatívne odhady, model neistoty alebo generatívny model podporovaných akcií.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-O-08

Odborná definícia

Odborná definícia

Offline reinforcement learning je paradigma, v ktorej sa politika učí výlučne z pevného datasetu minulých prechodov medzi stavmi, akciami a odmenami bez ďalšej interakcie s prostredím počas tréningu. Hlavným problémom je distribučný posun, pretože politika môže vybrať akcie slabo alebo vôbec nepokryté dátami a hodnotová funkcia im priradí neodôvodnene vysoký úžitok. Algoritmy preto obmedzujú politiku k správaniu v datasete, používajú konzervatívne odhady, model neistoty alebo generatívny model podporovaných akcií.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Nemocnica môže mať záznamy o minulých liečebných rozhodnutiach, no nový agent nesmie skúšať náhodné postupy na pacientoch. Offline RL sa pokúsi z týchto historických trajektórií naučiť lepšiu politiku. Dataset však ukazuje iba to, čo lekári skutočne zvolili, a výsledok môže byť ovplyvnený skrytým zdravotným stavom. Ak model odporučí kombináciu, ktorá v dátach takmer neexistuje, jej odhadovaný prínos je neistý. Pred použitím sú potrebné kauzálne analýzy, konzervatívne obmedzenia, simulácia a odborná validácia.

Časté otázky

Časté otázky

Prečo nemožno jednoducho použiť bežný online RL algoritmus?

Maximalizácia nad nepresným hodnotovým modelom zvýhodňuje akcie mimo podpory datasetu. Bez novej interakcie sa ich chyba neopraví a politika môže zneužiť extrapolačný omyl.

Čo znamená behavior policy?

Je to politika alebo zmes politík, ktoré vytvorili historické dáta. Nemusí byť explicitne zaznamenaná a jej neznalosť komplikuje odhad, ktoré akcie mali v danom stave reálnu šancu nastať.

Ako konzervatívne metódy znižujú riziko?

Penalizujú vysoké hodnoty pre málo podporované akcie alebo obmedzia novú politiku blízko dátového správania. Výsledkom môže byť menší teoretický zisk, ale nižšie riziko extrapolácie.

Ako sa offline politika hodnotí bez nasadenia?

Používa sa off-policy evaluation, model prostredia, simulátor a citlivostná analýza. Žiadna z metód neodstráni chybu pri slabej podpore, skrytom confoundingu alebo nesprávnom modeli odmeny.

Ktoré vlastnosti datasetu sú rozhodujúce?

Pokrytie relevantných stavov a akcií, kvalita odmien, dĺžka trajektórií, rozmanitosť správania a absencia systematických chýb. Veľký dataset môže byť stále nevhodný, ak opakuje úzku politiku.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Offline Reinforcement Learning: Tutorial, Review, and Perspectives D4RL, Datasets for Deep Data-Driven Reinforcement Learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.