Posilňované učenie a plánovanie

Hierarchical reinforcement learning

Hierarchické posilňované učenie

Hierarchical reinforcement learning je prístup, ktorý rozkladá dlhú rozhodovaciu úlohu na viac úrovní. Vyššia politika volí podcieľ, možnosť alebo zručnosť a nižšia politika vykonáva sekvenciu primitívnych akcií, kým sa podúloha neskončí. Hierarchia môže zlepšiť prieskum, opätovné použitie správania a priradenie odmeny pri dlhom horizonte. Formálne sa často opisuje cez options framework, kde možnosť obsahuje iniciačnú množinu, vnútornú politiku a podmienku ukončenia. Nesprávne podciele môžu obmedziť optimálne riešenie a prenášať chyby medzi úrovňami.

Posledná odborná revízia
29. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-H-16

Odborná definícia

Odborná definícia

Hierarchical reinforcement learning je prístup, ktorý rozkladá dlhú rozhodovaciu úlohu na viac úrovní. Vyššia politika volí podcieľ, možnosť alebo zručnosť a nižšia politika vykonáva sekvenciu primitívnych akcií, kým sa podúloha neskončí. Hierarchia môže zlepšiť prieskum, opätovné použitie správania a priradenie odmeny pri dlhom horizonte. Formálne sa často opisuje cez options framework, kde možnosť obsahuje iniciačnú množinu, vnútornú politiku a podmienku ukončenia. Nesprávne podciele môžu obmedziť optimálne riešenie a prenášať chyby medzi úrovňami.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Robot, ktorý má upratať miestnosť, nemusí plánovať každý pohyb motora od začiatku až po koniec. Horná úroveň vyberie podúlohu zdvihni predmet, prenes ho ku košu a vráť sa, zatiaľ čo spodná riadi uchopenie a kroky. Naučená zručnosť prenes predmet sa dá opakovane použiť v iných miestnostiach. Hierarchia skracuje rozhodovanie, ale zároveň zavádza hranice. Ak horná politika vyberie zlý podcieľ alebo sa zručnosť ukončí v nevhodnom stave, nízka úroveň môže vykonať svoju časť dokonale a celý plán napriek tomu zlyhá.

Časté otázky

Časté otázky

Čo je option v hierarchickom reinforcement learningu?

Option je časovo rozšírená akcia. Určuje, v ktorých stavoch sa môže spustiť, akú vnútornú politiku používa a s akou pravdepodobnosťou sa v jednotlivých stavoch ukončí.

Ako sa hierarchia líši od obyčajného reward shaping?

Reward shaping pridáva priebežné odmeny k jednej politike. Hierarchický prístup mení štruktúru rozhodovania tým, že vytvára podpolitiky alebo zručnosti s vlastným časovým rozsahom a podmienkami ukončenia.

Musia byť podciele zadané človekom?

Nie. Môžu byť navrhnuté doménovým expertom, odvodené zo stavových zmien alebo objavené bez dohľadu. Automaticky objavené podciele však nemusia byť zrozumiteľné ani užitočné pre cieľovú úlohu.

Prečo hierarchia pomáha pri riedkej odmene?

Nižšie úrovne môžu dostávať lokálny signál za dosiahnutie podcieľa, takže nemusia čakať na vzdialenú konečnú odmenu. Ak lokálne ciele nie sú v súlade s hlavným cieľom, vzniká suboptimálne správanie.

Ako sa testuje prenos zručností?

Naučená podpolitika sa nasadí v nových štartovacích stavoch, prostrediach alebo kombináciách úloh. Hodnotí sa úspešnosť, počet krokov a potreba ďalšieho učenia oproti politike trénovanej od začiatku.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Sutton, Precup a Singh, Between MDPs and semi-MDPs (doi.org) Barto a Mahadevan, Recent Advances in Hierarchical Reinforcement Learning (people.cs.umass.edu)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.