Odborná definícia
Význam a odborné vymedzenie pojmu
Proximal Policy Optimization, skrátene PPO, je on-policy actor-critic algoritmus, ktorý aktualizuje politiku pomocou surrogate objective a obmedzuje príliš veľkú zmenu pravdepodobností akcií medzi starou a novou politikou. Najznámejšia clipped verzia oreže pomer pravdepodobností mimo intervalu okolo jednej, čím znižuje motiváciu robiť deštruktívne kroky. PPO často používa generalized advantage estimation, value loss a entropy bonus. Je jednoduchšie implementovateľné než trust region metódy, ale zostáva citlivé na learning rate, počet epoch, clipping, normalizáciu rewardu a kvalitu batchov.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Agent zozbiera trajektórie so súčasnou politikou a potom ich niekoľkokrát použije na učenie. Bez obmedzenia by jedna aktualizácia mohla prudko zvýšiť pravdepodobnosť náhodne úspešnej akcie a zničiť predchádzajúce správanie. PPO sleduje pomer novej a starej pravdepodobnosti a nadmerný posun prestane odmeňovať. Clipping však nie je bezpečnostná záruka a nezabráni optimalizácii zlého rewardu. Pri RLHF alebo robotike treba sledovať KL divergenciu, kolaps entropy, value error, distribúciu odmien a reálne neželané správanie.
Časté otázky
Otázky, ktoré spresňujú význam
Prečo sa PPO nazýva proximal?
Snaží sa držať novú politiku blízko politiky, ktorá zozbierala dáta. Clipped objective alebo KL penalizácia obmedzujú príliš veľký krok v priestore pravdepodobností akcií.
Čo robí clipping parameter epsilon?
Určuje interval, v ktorom sa pomer novej a starej pravdepodobnosti môže zlepšovať bez orezania objective. Príliš malá hodnota spomaľuje učenie, príliš veľká oslabuje stabilizačný efekt.
Je PPO off-policy algoritmus?
Nie, štandardne je on-policy. Dáta pochádzajú z aktuálnej alebo veľmi blízkej politiky a po niekoľkých epochách sa zahodia. Veľké replay buffery nie sú jeho typickou súčasťou.
Ako PPO súvisí s RLHF?
Môže optimalizovať jazykový model podľa reward modelu pri penalizácii odchýlky od referenčnej politiky. Kvalita závisí od reward modelu a môže vzniknúť reward hacking alebo mode collapse.
Ktoré signály treba monitorovať?
Policy loss, value loss, entropy, approximate KL, clip fraction, advantage štatistiky, reward komponenty a výkon na nezávislých scenároch. Jediný rast priemernej odmeny nestačí.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Schulman et al., Proximal Policy Optimization Algorithms
- OpenAI Spinning Up, PPO
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
