Sekvenční rozhodování z historických dat

Offline posilované učení

Offline reinforcement learning je paradigma, ve které se politika učí výlučne z pevného datasetu minulých prechodů mezi stavmi, akciami a odmenami bez další interakce s prostredím během tréninku. Hlavním problémem je distribučný posun, protože politika může vybrat akce slabo nebo vůbec nepokryté daty a hodnotová funkce im přiřadí neodůvodnene vysoký úžitok. Algoritmy proto obmedzují politiku k chování v datasete, používají konzervatívne odhady, model nejistoty nebo generativní model podporovaných akcií.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-O-08

Odborná definice

Odborná definice

Offline reinforcement learning je paradigma, ve které se politika učí výlučne z pevného datasetu minulých prechodů mezi stavmi, akciami a odmenami bez další interakce s prostredím během tréninku. Hlavním problémem je distribučný posun, protože politika může vybrat akce slabo nebo vůbec nepokryté daty a hodnotová funkce im přiřadí neodůvodnene vysoký úžitok. Algoritmy proto obmedzují politiku k chování v datasete, používají konzervatívne odhady, model nejistoty nebo generativní model podporovaných akcií.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Nemocnica může mít záznamy o minulých liečebných rozhodnutích, ale nový agent nesmí skúšat náhodné postupy na pacientoch. Offline RL se pokúsi z těchto historických trajektorií naučit lepší politiku. Dataset však ukazuje pouze to, co lekári skutečně zvolili, a výsledek může být ovplyvnený skrytým zdravotným stavem. Pokud model odporučí kombinaci, která v datech téměř neexistuje, její odhadovaný přínos je neistý. Před použitím jsou potřebné kauzální analýzy, konzervatívne omezení, simulace a odborná validace.

Časté otázky

Časté otázky

Proč nelze jednoduše použít běžný online RL algoritmus?

Maximalizace nad nepresným hodnotovým modelem zvýhodňuje akce mimo podpory datasetu. Bez nové interakce se jejich chyba neopraví a politika může zneužit extrapolačný omyl.

Co znamená behavior policy?

Je to politika nebo zmes politík, které vytvořili historické data. Nemusí být explicitně zaznamenaná a její neznalosť komplikuje odhad, které akce měli v daném stave reálnou šancu nastat.

Jako konzervatívne metody snižují riziko?

Penalizují vysoké hodnoty pro málo podporované akce nebo obmedze novou politiku blízko datového chování. Výsledkem může být menší teoretický zisk, ale nižší riziko extrapolace.

Jak se offline politika hodnotí bez nasazení?

Používá se off-policy evaluation, model prostředí, simulátor a citlivostná analýza. Žiadna z metod neodstráni chybu při slabé podpoře, skrytom confoundingu nebo nesprávném modeli odměny.

Které vlastnosti datasetu jsou rozhodující?

Pokrytí relevantních stavů a akcií, kvalita odmien, délka trajektorií, rozmanitost chování a absence systematických chyb. Velký dataset může být stále nevhodný, pokud opakuje úzku politiku.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Offline Reinforcement Learning: Tutorial, Review, and Perspectives D4RL, Datasets for Deep Data-Driven Reinforcement Learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.