Posilňované učenie a reasoning

Verifiable reward

overiteľná odmena

Verifiable reward je odmeňovací signál, ktorého správnosť možno určiť automatickým, reprodukovateľným testom namiesto subjektívneho hodnotenia človeka. Typickým príkladom je správny výsledok matematickej úlohy, prejdenie testov programu, platný dôkaz alebo splnenie formálneho obmedzenia. Umožňuje škálovať reinforcement learning na úlohy s jasným rozhodcom, no hodnotí iba to, čo verifier dokáže zachytiť. Model môže exploitovať chyby testu, optimalizovať formát namiesto kvality alebo nájsť nežiaduce riešenie, ktoré formálne prejde.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-12

Odborná definícia

Odborná definícia

Verifiable reward je odmeňovací signál, ktorého správnosť možno určiť automatickým, reprodukovateľným testom namiesto subjektívneho hodnotenia človeka. Typickým príkladom je správny výsledok matematickej úlohy, prejdenie testov programu, platný dôkaz alebo splnenie formálneho obmedzenia. Umožňuje škálovať reinforcement learning na úlohy s jasným rozhodcom, no hodnotí iba to, čo verifier dokáže zachytiť. Model môže exploitovať chyby testu, optimalizovať formát namiesto kvality alebo nájsť nežiaduce riešenie, ktoré formálne prejde.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Pri písaní eseje sa ľudia môžu nezhodnúť, ktorá odpoveď je najlepšia. Pri programe sa dá spustiť sada testov a jednoznačne zistiť, či funguje na zadaných prípadoch. Takýto automatický rozhodca vytvára overiteľnú odmenu. Model môže skúšať viac postupov a dostane bod, keď výsledok prejde kontrolou. Problém nastane, ak testy nepokrývajú dôležitý okrajový prípad alebo sa dajú obísť. Odmena je potom presná vzhľadom na verifier, nie nevyhnutne vzhľadom na skutočný zámer.

Časté otázky

Časté otázky

Ktoré úlohy majú prirodzene verifiable rewards?

Matematika s kontrolovateľným výsledkom, kód s testami, logické úlohy, formálne dôkazy, hry a optimalizácia s explicitnými obmedzeniami.

Ako sa líši verifiable reward od reward modelu?

Verifier používa pravidlo alebo vykonateľný test. Reward model odhaduje kvalitu z naučených preferencií a môže byť nepresný mimo tréningovej distribúcie.

Čo je verifier hacking?

Model nájde spôsob, ako získať odmenu bez splnenia zamýšľaného cieľa, napríklad využije chybu testu, parsera alebo nedostatočnú kontrolu vstupu.

Stačí kontrolovať finálnu odpoveď?

Nie vždy. Správny výsledok môže vzniknúť náhodou alebo nebezpečným postupom. Pri kritických úlohách sa overuje aj dôkaz, trace, zdroje alebo vykonané kroky.

Prečo sú overiteľné odmeny dôležité pre reasoning modely?

Umožňujú vytvoriť veľké množstvo spoľahlivých tréningových epizód bez ručného hodnotenia každej trajektórie, najmä pri matematike a programovaní.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Let's Verify Step by Step DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.