Odborná definícia
Odborná definícia
Verifiable reward je odmeňovací signál, ktorého správnosť možno určiť automatickým, reprodukovateľným testom namiesto subjektívneho hodnotenia človeka. Typickým príkladom je správny výsledok matematickej úlohy, prejdenie testov programu, platný dôkaz alebo splnenie formálneho obmedzenia. Umožňuje škálovať reinforcement learning na úlohy s jasným rozhodcom, no hodnotí iba to, čo verifier dokáže zachytiť. Model môže exploitovať chyby testu, optimalizovať formát namiesto kvality alebo nájsť nežiaduce riešenie, ktoré formálne prejde.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Pri písaní eseje sa ľudia môžu nezhodnúť, ktorá odpoveď je najlepšia. Pri programe sa dá spustiť sada testov a jednoznačne zistiť, či funguje na zadaných prípadoch. Takýto automatický rozhodca vytvára overiteľnú odmenu. Model môže skúšať viac postupov a dostane bod, keď výsledok prejde kontrolou. Problém nastane, ak testy nepokrývajú dôležitý okrajový prípad alebo sa dajú obísť. Odmena je potom presná vzhľadom na verifier, nie nevyhnutne vzhľadom na skutočný zámer.
Časté otázky
Časté otázky
Ktoré úlohy majú prirodzene verifiable rewards?
Matematika s kontrolovateľným výsledkom, kód s testami, logické úlohy, formálne dôkazy, hry a optimalizácia s explicitnými obmedzeniami.
Ako sa líši verifiable reward od reward modelu?
Verifier používa pravidlo alebo vykonateľný test. Reward model odhaduje kvalitu z naučených preferencií a môže byť nepresný mimo tréningovej distribúcie.
Čo je verifier hacking?
Model nájde spôsob, ako získať odmenu bez splnenia zamýšľaného cieľa, napríklad využije chybu testu, parsera alebo nedostatočnú kontrolu vstupu.
Stačí kontrolovať finálnu odpoveď?
Nie vždy. Správny výsledok môže vzniknúť náhodou alebo nebezpečným postupom. Pri kritických úlohách sa overuje aj dôkaz, trace, zdroje alebo vykonané kroky.
Prečo sú overiteľné odmeny dôležité pre reasoning modely?
Umožňujú vytvoriť veľké množstvo spoľahlivých tréningových epizód bez ručného hodnotenia každej trajektórie, najmä pri matematike a programovaní.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Let's Verify Step by Step DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
