Odborná definícia
Odborná definícia
Hierarchical reinforcement learning je prístup, ktorý rozkladá dlhú rozhodovaciu úlohu na viac úrovní. Vyššia politika volí podcieľ, možnosť alebo zručnosť a nižšia politika vykonáva sekvenciu primitívnych akcií, kým sa podúloha neskončí. Hierarchia môže zlepšiť prieskum, opätovné použitie správania a priradenie odmeny pri dlhom horizonte. Formálne sa často opisuje cez options framework, kde možnosť obsahuje iniciačnú množinu, vnútornú politiku a podmienku ukončenia. Nesprávne podciele môžu obmedziť optimálne riešenie a prenášať chyby medzi úrovňami.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Robot, ktorý má upratať miestnosť, nemusí plánovať každý pohyb motora od začiatku až po koniec. Horná úroveň vyberie podúlohu zdvihni predmet, prenes ho ku košu a vráť sa, zatiaľ čo spodná riadi uchopenie a kroky. Naučená zručnosť prenes predmet sa dá opakovane použiť v iných miestnostiach. Hierarchia skracuje rozhodovanie, ale zároveň zavádza hranice. Ak horná politika vyberie zlý podcieľ alebo sa zručnosť ukončí v nevhodnom stave, nízka úroveň môže vykonať svoju časť dokonale a celý plán napriek tomu zlyhá.
Časté otázky
Časté otázky
Čo je option v hierarchickom reinforcement learningu?
Option je časovo rozšírená akcia. Určuje, v ktorých stavoch sa môže spustiť, akú vnútornú politiku používa a s akou pravdepodobnosťou sa v jednotlivých stavoch ukončí.
Ako sa hierarchia líši od obyčajného reward shaping?
Reward shaping pridáva priebežné odmeny k jednej politike. Hierarchický prístup mení štruktúru rozhodovania tým, že vytvára podpolitiky alebo zručnosti s vlastným časovým rozsahom a podmienkami ukončenia.
Musia byť podciele zadané človekom?
Nie. Môžu byť navrhnuté doménovým expertom, odvodené zo stavových zmien alebo objavené bez dohľadu. Automaticky objavené podciele však nemusia byť zrozumiteľné ani užitočné pre cieľovú úlohu.
Prečo hierarchia pomáha pri riedkej odmene?
Nižšie úrovne môžu dostávať lokálny signál za dosiahnutie podcieľa, takže nemusia čakať na vzdialenú konečnú odmenu. Ak lokálne ciele nie sú v súlade s hlavným cieľom, vzniká suboptimálne správanie.
Ako sa testuje prenos zručností?
Naučená podpolitika sa nasadí v nových štartovacích stavoch, prostrediach alebo kombináciách úloh. Hodnotí sa úspešnosť, počet krokov a potreba ďalšieho učenia oproti politike trénovanej od začiatku.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Sutton, Precup a Singh, Between MDPs and semi-MDPs (doi.org) Barto a Mahadevan, Recent Advances in Hierarchical Reinforcement Learning (people.cs.umass.edu)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
