Odborná definícia
Odborná definícia
Imitation learning učí agenta vykonávať úlohu z ukážok správania experta namiesto priameho definovania odmeny pre každý stav. Pri behavior cloning sa demonštrácie premenia na páry pozorovanie a akcia a politika sa trénuje ako supervidovaný model. Interaktívne metódy, napríklad DAgger, zbierajú opravy experta aj v stavoch, do ktorých sa dostane samotný žiak. Hlavným problémom je distribučný posun, pretože malá chyba zavedie agenta mimo trás pozorovaných v dátach a ďalšie rozhodnutia sa kumulatívne zhoršujú. Výkon závisí od kvality demonštrácií, pokrytia stavov a definície pozorovania.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Robot má naučiť uchopiť šálku. Operátor mu niekoľkokrát ukáže pohyb ruky, polohu kamery a správne zatvorenie chápadla. Pri obyčajnom kopírovaní robot napodobní známe situácie, no po malom posunutí šálky sa môže dostať do polohy, ktorú nikdy nevidel. DAgger nechá robota skúšať vlastnú politiku a expert označí, čo mal urobiť v nových stavoch. Dataset sa tak rozšíri o chyby žiaka, nie iba o ideálnu trasu učiteľa. Metóda šetrí návrh odmeny, ale prenáša aj expertove zlozvyky a potrebuje bezpečný spôsob skúšania.
Časté otázky
Časté otázky
Čím sa imitation learning líši od reinforcement learning?
Imitačný prístup čerpá cieľ zo správania experta. Posilňované učenie optimalizuje kumulatívnu odmenu a môže objaviť inú stratégiu. V praxi sa obe metódy často kombinujú.
Prečo behavior cloning trpí kumuláciou chýb?
Trénuje sa na stavoch navštívených expertom, ale pri nasadení koná podľa vlastných predikcií. Jedna odchýlka zmení ďalší vstup a politika môže postupne opustiť známu distribúciu.
Čo presne pridáva algoritmus DAgger?
Žiak vykonáva svoju politiku, expert označí správne akcie pre navštívené stavy a nové dvojice sa pridajú k tréningovým dátam. Tým sa model pripravuje na následky vlastných omylov.
Musí expert ovládať úlohu dokonale?
Nie, ale nekonzistentné alebo suboptimálne ukážky určujú strop jednoduchého napodobňovania. Dáta možno vážiť, filtrovať, porovnávať viacerých expertov alebo neskôr politiku zlepšiť pomocou odmeny.
Ako sa rieši bezpečnosť pri interaktívnom zbere?
Používa sa simulácia, obmedzenie akcií, bezpečnostný kontrolér, vzdialené zastavenie a postupné rozširovanie povoleného priestoru. Expert musí vedieť zasiahnuť skôr, než chyba spôsobí škodu.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Ross, Gordon a Bagnell, A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (proceedings.mlr.press)
- OpenAI Spinning Up, Imitation Learning (spinningup.openai.com)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
