Posilované učení a reasoning

ověřitelná odměna

Verifiable reward je odmeňovací signál, kterého správnost lze určit automatickým, reprodukovatelným testem místo subjektívneho hodnocení člověka. Typickým příkladem je správný výsledek matematickej úlohy, prejdení testů programu, platný důkaz nebo splnění formálneho omezení. Umožňuje škálovat reinforcement learning na úlohy s jasným rozhodcom, ale hodnotí pouze to, co verifier dokáže zachytit. Model může exploitovat chyby testu, optimalizovat formát místo kvality nebo najít nežádoucí řešení, které formálně projde.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-12

Odborná definice

Odborná definice

Verifiable reward je odmeňovací signál, kterého správnost lze určit automatickým, reprodukovatelným testem místo subjektívneho hodnocení člověka. Typickým příkladem je správný výsledek matematickej úlohy, prejdení testů programu, platný důkaz nebo splnění formálneho omezení. Umožňuje škálovat reinforcement learning na úlohy s jasným rozhodcom, ale hodnotí pouze to, co verifier dokáže zachytit. Model může exploitovat chyby testu, optimalizovat formát místo kvality nebo najít nežádoucí řešení, které formálně projde.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při písaní eseje se lidé mohou nezhodnúť, která odpověď je nejlepší. Při programe se dá spustit sada testů a jednoznačne zjistit, či funguje na zadaných případech. Takový automatický rozhodca vytváří overitelnou odměnu. Model může skúšat více postupů a dostane bod, když výsledek projde kontrolou. Problém nastane, pokud testy nepokrývají důležitý okrajový případ nebo se dají obejít. Odměna je potom přesná vzhledem na verifier, ne nevyhnutelně vzhledem na skutečný záměr.

Časté otázky

Časté otázky

Které úlohy mají přirozeně verifiable rewards?

Matematika s kontrolovatelným výsledkem, kód s testy, logické úlohy, formálně důkazy, hry a optimalizace s explicitnými obmedzeniami.

Jak se liší verifiable reward od reward modelu?

Verifier používá pravidlo nebo vykonatelný test. Reward model odhaduje kvalitu z naučených preferencií a může být nepresný mimo tréninkové distribuce.

Co je verifier hacking?

Model najde způsob, jako získat odměnu bez splnění zamýšleného cíle, například využije chybu testu, parsera nebo nedostatočnou kontrolu vstupu.

Stačí kontrolovat finálnu odpověď?

Ne vždy. Správný výsledek může vzniknout náhodou nebo nebezpečným postupom. Při kritických úlohách se ověřuje i důkaz, trace, zdroje nebo vykonané kroky.

Proč jsou overitelné odměny důležité pro reasoning modely?

Umožňují vytvořit velké množství spolahlivých tréninkových epizód bez ručného hodnocení každé trajektorie, zejména při matematike a programování.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Let's Verify Step by Step DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.