Trénovanie a optimalizácia · Reinforcement learning a stabilné aktualizácie

Proximálna optimalizácia politiky

Proximal Policy Optimization

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-24

Odborná definícia

Význam a odborné vymedzenie pojmu

Proximal Policy Optimization, skrátene PPO, je on-policy actor-critic algoritmus, ktorý aktualizuje politiku pomocou surrogate objective a obmedzuje príliš veľkú zmenu pravdepodobností akcií medzi starou a novou politikou. Najznámejšia clipped verzia oreže pomer pravdepodobností mimo intervalu okolo jednej, čím znižuje motiváciu robiť deštruktívne kroky. PPO často používa generalized advantage estimation, value loss a entropy bonus. Je jednoduchšie implementovateľné než trust region metódy, ale zostáva citlivé na learning rate, počet epoch, clipping, normalizáciu rewardu a kvalitu batchov.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Agent zozbiera trajektórie so súčasnou politikou a potom ich niekoľkokrát použije na učenie. Bez obmedzenia by jedna aktualizácia mohla prudko zvýšiť pravdepodobnosť náhodne úspešnej akcie a zničiť predchádzajúce správanie. PPO sleduje pomer novej a starej pravdepodobnosti a nadmerný posun prestane odmeňovať. Clipping však nie je bezpečnostná záruka a nezabráni optimalizácii zlého rewardu. Pri RLHF alebo robotike treba sledovať KL divergenciu, kolaps entropy, value error, distribúciu odmien a reálne neželané správanie.

Časté otázky

Otázky, ktoré spresňujú význam

Prečo sa PPO nazýva proximal?

Snaží sa držať novú politiku blízko politiky, ktorá zozbierala dáta. Clipped objective alebo KL penalizácia obmedzujú príliš veľký krok v priestore pravdepodobností akcií.

Čo robí clipping parameter epsilon?

Určuje interval, v ktorom sa pomer novej a starej pravdepodobnosti môže zlepšovať bez orezania objective. Príliš malá hodnota spomaľuje učenie, príliš veľká oslabuje stabilizačný efekt.

Je PPO off-policy algoritmus?

Nie, štandardne je on-policy. Dáta pochádzajú z aktuálnej alebo veľmi blízkej politiky a po niekoľkých epochách sa zahodia. Veľké replay buffery nie sú jeho typickou súčasťou.

Ako PPO súvisí s RLHF?

Môže optimalizovať jazykový model podľa reward modelu pri penalizácii odchýlky od referenčnej politiky. Kvalita závisí od reward modelu a môže vzniknúť reward hacking alebo mode collapse.

Ktoré signály treba monitorovať?

Policy loss, value loss, entropy, approximate KL, clip fraction, advantage štatistiky, reward komponenty a výkon na nezávislých scenároch. Jediný rast priemernej odmeny nestačí.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Schulman et al., Proximal Policy Optimization Algorithms
  • OpenAI Spinning Up, PPO

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.