Odborná definícia
Význam a odborné vymedzenie pojmu
Reinforcement learning from human feedback, RLHF, je postup prispôsobenia modelu, pri ktorom ľudia poskytujú demonštrácie, preferencie alebo hodnotenia výstupov a z nich sa vytvorí optimalizačný signál. Klasická pipeline zahŕňa supervised fine-tuning, tréning reward modelu z párových porovnaní a následnú optimalizáciu politiky s obmedzením odchýlky od referenčného modelu. RLHF môže zlepšiť nasledovanie pokynov, no zdedí nejednotnosť anotátorov, medzery v pokrytí a zraniteľnosť reward modelu voči overoptimization.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Ľudia nemusia napísať presnú správnu odpoveď pre každý prompt. Môžu porovnať dve odpovede a označiť, ktorá je užitočnejšia, bezpečnejšia alebo lepšie rešpektuje zadanie. Z týchto volieb sa naučí model odmeny a jazykový model sa ďalej trénuje, aby získaval vyššie hodnotenie. Proces vie meniť správanie vo veľkom meradle, ale ľudská preferencia nie je objektívna pravda. Ak sú pravidlá nejasné alebo vzorka úzka, model sa naučí štýl hodnotiteľov namiesto všeobecnej kvality.
Časté otázky
Otázky, ktoré spresňujú význam
Aké kroky tvorí typická RLHF pipeline?
Najprv supervised fine-tuning na kvalitných odpovediach, potom zber párových preferencií, tréning reward modelu a napokon optimalizácia politiky, často s KL penalizáciou.
Je DPO to isté ako RLHF?
DPO využíva preferenčné dáta priamo bez samostatnej on-policy RL slučky a explicitného reward modelu. Patrí do širšej rodiny preference optimization, ale implementačne sa líši.
Prečo sa meria zhoda anotátorov?
Nízka zhoda odhaľuje nejasné kritériá, kultúrne rozdiely alebo ťažké prípady. Bez nej môže reward model predstierať presnosť v oblasti, kde ani ľudia nemajú stabilný konsenzus.
Môže RLHF odstrániť halucinácie?
Nie. Môže znížiť niektoré nežiaduce vzorce a naučiť model priznať neistotu, ale faktická správnosť závisí aj od dát, retrievalu, evaluácie a kontextu.
Čo je reward overoptimization?
Politika začne využívať slabiny reward modelu a zvyšuje jeho skóre bez reálneho zlepšenia ľudskej kvality. Preto sa sledujú nezávislé evaly a obmedzuje veľkosť aktualizácie.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Ouyang et al., Training language models to follow instructions with human feedback, 2022
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
