Učení politiky z demonštrací

Imitační učení

Imitation learning učí agenta provádět úlohu z ukážok chování experta místo přímého definování odměny pro každý stav. Při behavior cloning se demonštrace premení na páry pozorování a akce a politika se trénuje jako supervidovaný model. Interaktívne metody, například Dagger, zbierají opravy experta i v stavech, do kterých se dostane samotný žiak. Hlavním problémem je distribučný posun, protože malá chyba zavedie agenta mimo trás pozorovaných v datech a další rozhodnutí se kumulatívne zhoršují. Výkon závisí na kvality demonštrací, pokrytí stavů a definice pozorování.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-09

Odborná definice

Odborná definice

Imitation learning učí agenta provádět úlohu z ukážok chování experta místo přímého definování odměny pro každý stav. Při behavior cloning se demonštrace premení na páry pozorování a akce a politika se trénuje jako supervidovaný model. Interaktívne metody, například Dagger, zbierají opravy experta i v stavech, do kterých se dostane samotný žiak. Hlavním problémem je distribučný posun, protože malá chyba zavedie agenta mimo trás pozorovaných v datech a další rozhodnutí se kumulatívne zhoršují. Výkon závisí na kvality demonštrací, pokrytí stavů a definice pozorování.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Robot má naučit uchopit šálku. Operátor mu niekolkokrát ukáže pohyb ruky, polohu kamery a správně zatvorení chápadla. Při obyčajnom kopírování robot napodobní známé situace, ale po malém posunutí šálky se může dostat do polohy, kterou nikdy neviděl. Dagger nechá robota skúšat vlastní politiku a expert označí, co měl urobit v nových stavech. Dataset se tak rozšíri o chyby žiaka, ne pouze o ideálnu trasu učitela. Metoda šetří návrh odměny, ale přenáší i expertove zlozvyky a potřebuje bezpečný způsob skúšání.

Časté otázky

Časté otázky

Čím se imitation learning liší od reinforcement learning?

Imitačný přístup čerpá cíl ze chování experta. Posilované učení optimalizuje kumulatívnu odměnu a může objavit jinou strategii. V praxi se obě metody často kombinují.

Proč behavior cloning trpí kumulací chyb?

Trénuje se na stavech navštívených expertom, ale při nasazení koná podle vlastních predikcí. Jedna odchýlka změní další vstup a politika může postupně opustit známu distribuci.

Co přesně přidává algoritmus Dagger?

Žiak provádí svoju politiku, expert označí správně akce pro navštívené stavy a nové dvojice se pridají k tréninkovým datům. Tím se model pripravuje na následky vlastních omylů.

Musí expert ovládat úlohu dokonale?

Ne, ale nekonzistentné nebo suboptimálne ukázky určují strop jednoduchého napodobňování. Data lze vážiť, filtrovat, porovnávat více expertů nebo později politiku zlepšit pomocí odměny.

Jak se řeší bezpečnost při interaktívnom zbere?

Používá se simulace, omezení akcií, bezpečnostní kontrolér, vzdálené zastavení a postupné rozširování povoleného prostoru. Expert musí vědět zasáhnout dříve, než chyba spůsobí škodu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Ross, Gordon a Bagnell, A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (proceedings.mlr.press)
  • OpenAI Spinning Up, Imitation Learning (spinningup.openai.com)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.