Odborná definice
Odborná definice
Proximal Policy Optimization, zkráceně PPO, je on-policy actor-critic algoritmus, který aktualizuje politiku pomocí surrogate objective a omezuje příliš velkou změnu pravděpodobností akcií mezi starou a novou politikou. Najznámejšia clipped verze oreže poměr pravděpodobností mimo intervalu okolo jedné, čím snižuje motivaci dělat deštruktívne kroky. PPO často používá generalized advantage estimation, value loss a entropy bonus. Je jednodušší implementovatelné než trust region metody, ale zůstává citlivé na learning rate, počet epoch, clipping, normalizaci rewardu a kvalitu batchů.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Agent zozbiera trajektorie se súčasnou politikou a potom jejich niekolkokrát použije na učení. Bez omezení by jedna aktualizace mohla prudko zvýšit pravděpodobnost náhodně úspešnej akce a zničit předchozí chování. PPO sleduje poměr nové a starej pravděpodobnosti a nadmerný posun přestane odmeňovat. Clipping však není bezpečnostní záruka a nezabráni optimalizaci zlého rewardu. Při RLHF nebo robotike je třeba sledovat KL divergenci, kolaps entropy, value error, distribuci odmien a reálně neželané chování.
Časté otázky
Časté otázky
Proč se PPO nazýva proximal?
Snaží se držet novou politiku blízko politiky, která zozbierala data. Clipped objective nebo KL penalizace obmedzují příliš velký krok v prostoru pravděpodobností akcií.
Co dělá clipping parameter epsilon?
Určuje interval, ve kterém se poměr nové a starej pravděpodobnosti může zlepšovat bez orezání objective. Příliš malá hodnota spomaluje učení, příliš velká oslabuje stabilizačný efekt.
Je PPO off-policy algoritmus?
Ne, štandardne je on-policy. Data pochádzají z aktuální nebo velmi blízkej politiky a po několika epochách se zahodia. Velké replay buffery nejsou jeho typickou součástí.
Jako PPO souvisí s RLHF?
Může optimalizovat jazykový model podle reward modelu při penalizaci odchylky od referenční politiky. Kvalita závisí na reward modelu a může vzniknout reward hacking nebo mode collapse.
Které signály je třeba monitorovat?
Policy loss, value loss, entropy, approximate KL, clip fraction, advantage statistiky, reward komponenty a výkon na nezávislých scenároch. Jediný rast průměrné odměny nestačí.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Schulman et al., Proximal Policy Optimization Algorithms
- OpenAI Spinning Up, PPO
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
