Odborná definice
Odborná definice
Hierarchical reinforcement learning je přístup, který rozkladá dlhú rozhodovací úlohu na více úrovní. Vyšší politika volí podciel, možnost nebo zručnost a nižší politika provádí sekvenci primitívnych akcií, zatímco se podúloha neskončí. Hierarchie může zlepšit prieskum, opetovné použití chování a přiřazení odměny při dlouhém horizonte. Formálně se často popisuje přes options framework, kde možnost obsahuje iniciačnou množinu, vnitřní politiku a podmínku ukončení. Nesprávně podciele mohou omezit optimálne řešení a prenášat chyby mezi úrovňami.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Robot, který má upratat miestnost, nemusí plánovat každý pohyb motora od začátku až po koniec. Horní úroveň vybere podúlohu zdvihni predmet, prenes ho ku košu a vráť se, zatímco spodná řídí uchopení a kroky. Naučená zručnost prenes predmet se dá opakovaně použít v jiných miestnostiach. Hierarchie skracuje rozhodování, ale zároveň zavádí hranice. Pokud horní politika vybere zlý podciel nebo se zručnost ukončí v nevhodném stave, nízká úroveň může provést svoju část dokonale a celý plán navzdory tomu selže.
Časté otázky
Časté otázky
Co je option v hierarchickom reinforcement learningu?
Option je časovo rozšírená akce. Určuje, ve kterých stavech se může spustit, jakou vnitřní politiku používá a s akou pravděpodobností se v jednotlivých stavech ukončí.
Jak se hierarchie liší od obyčajného reward shaping?
Reward shaping přidává priebežné odměny k jedné politice. Hierarchický přístup mění strukturu rozhodování tím, že vytváří podpolitiky nebo zručnosti s vlastným časovým rozsahem a podmienkami ukončení.
Musí být podciele zadané člověkem?
Ne. Mohou být navržené doménovým expertom, odvozené ze stavových změn nebo objavené bez dohladu. Automaticky objavené podciele však nemusí být zrozumitelné ani užitečné pro cílovou úlohu.
Proč hierarchie pomáhá při riedkej odměně?
Nižší úrovně mohou dostávat lokální signál za dosiahnutie podciela, takže nemusí čekat na vzdialenou konečnou odměnu. Pokud lokálně cíle nejsou v súlade s hlavním cílem, vzniká suboptimálne chování.
Jak se testuje přenos zručností?
Naučená podpolitika se nasadí v nových štartovacích stavech, prostrediach nebo kombinacích úloh. Hodnotí se úspěšnost, počet kroků a potřeba dalšího učení oproti politice trénovanej od začátku.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Sutton, Precup a Singh, Between MDPs and semi-MDPs (doi.org) Barto a Mahadevan, Recent Advances in Hierarchical Reinforcement Learning (people.cs.umass.edu)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
