Odborná definícia
Význam a odborné vymedzenie pojmu
Reward model je naučená funkcia, ktorá priraďuje skóre výstupu, trajektórii alebo dvojici vstup a výstup podľa odhadovanej ľudskej preferencie či iného cieľa. Často sa trénuje z párových porovnaní, kde sa optimalizuje pravdepodobnosť, že preferovaný výstup získa vyššie skóre. Následne môže poskytovať odmenu pri RLHF, filtrovať kandidátov alebo slúžiť ako pomocný evaluátor. Skóre je relatívne voči tréningovým dátam, môže byť nekalibrované a pri silnej optimalizácii zraniteľné voči exploitation.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Model odmeny sa učí napodobniť hodnotiteľa. Dostane dve odpovede a trénuje sa tak, aby vyššie ohodnotil tú, ktorú človek uprednostnil. Keď sa naučí dostatočne dobre, môže hodnotiť oveľa viac výstupov než ľudia priamo a poskytovať signál pre ďalší tréning. Nie je však nezávislým sudcom pravdy. Ak nevidel určitý typ problému alebo si politika všimne jeho slabinu, vysoké skóre môže znamenať iba úspešné prispôsobenie sa modelu hodnotenia. Preto sa jeho skóre kontroluje na čerstvých ľudských posudkoch a mimo tréningovej distribúcie.
Časté otázky
Otázky, ktoré spresňujú význam
Čo vstupuje do reward modelu?
Zvyčajne prompt spolu s kandidátnou odpoveďou, prípadne celá trajektória agenta. Model môže dostať aj systémové pravidlá alebo doménový kontext používaný hodnotiteľmi.
Ako sa trénuje z párových preferencií?
Skóre dvoch výstupov sa porovná logistickou stratou, ktorá zvýhodní človekom zvolený výstup. Dáta musia obsahovať jasné inštrukcie a kontrolu kvality anotácií.
Prečo môže vysoká reward hodnota klamať?
Politika sa môže dostať mimo distribúciu porovnaní a nájsť textové vzorce, ktoré reward model preceňuje. Preto sa sleduje ľudské hodnotenie a nezávislé evaly.
Má reward model vyjadrovať neistotu?
Je to užitočné pri neznámych prípadoch. Ensemble, kalibrácia alebo abstention môžu označiť nízku dôveru, ale neistota sa musí overiť na realistických dátach.
Môže jeden reward model pokryť všetky ciele?
Zvyčajne nie. Užitočnosť, bezpečnosť, pravdivosť a štýl môžu byť v konflikte. Viac modelov alebo viacrozmerné hodnotenie umožňuje transparentnejšie riadiť kompromisy.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Ouyang et al., Training language models to follow instructions with human feedback, 2022
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
