Odborná definice
Odborná definice
Reward model je naučená funkce, která přiřazuje skóre výstupu, trajektórii nebo dvojici vstup a výstup podle odhadovanej lidské preference či jiného cíle. Často se trénuje z párových porovnání, kde se optimalizuje pravděpodobnost, že preferovaný výstup získá vyšší skóre. Následně může poskytovat odměnu při RLHF, filtrovat kandidátů nebo slúžit jako pomocný evaluátor. Skóre je relativně vůči tréninkovým datům, může být nekalibrované a při silné optimalizaci zranitelné vůči exploitation.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Model odměny se učí napodobnit hodnotitela. Dostane dvě odpovědi a trénuje se tak, aby vyšší ohodnotil tu, kterou člověk uprednostnil. Když se naučí dostatečně dobře, může hodnotit ovela více výstupů než lidé přímo a poskytovat signál pro další trénink. Není však nezávislým sudcom pravdy. Pokud neviděl určitý typ problému nebo si politika všimne jeho slabinu, vysoké skóre může znamenat pouze úspěšné přizpůsobení se modelu hodnocení. Proto se jeho skóre kontroluje na čerstvých lidských posudkoch a mimo tréninkové distribuce.
Časté otázky
Časté otázky
Co vstupuje do reward modelu?
Obvykle prompt spolu s kandidátnou odpovědí, případně celá trajektorie agenta. Model může dostat i systémové pravidla nebo doménový kontext používaný hodnotitelmi.
Jak se trénuje z párových preferencií?
Skóre dvou výstupů se porovná logistickou ztrátou, která zvýhodní člověkem zvolený výstup. Data musí obsahovat jasné instrukce a kontrolu kvality anotací.
Proč může vysoká reward hodnota klamat?
Politika se může dostat mimo distribuci porovnání a najít textové vzorce, které reward model preceňuje. Proto se sleduje lidské hodnocení a nezávislé evaly.
Má reward model vyjadrovat nejistotu?
Je to užitečné při neznámých případech. Ensemble, kalibrace nebo abstention mohou označit nízkou důveru, ale nejistota se musí ověřit na realistických datech.
Může jeden reward model pokrýt všechny cíle?
Obvykle ne. Užitečnost, bezpečnost, pravdivost a styl mohou být v konflikte. Více modelů nebo vícerozměrné hodnocení umožňuje transparentnejšie riadit kompromisy.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Ouyang et al., Training language models to follow instructions with human feedback, 2022
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
