Trénovanie a optimalizácia · Zlaďovanie generatívnych modelov

Posilňované učenie z ľudskej spätnej väzby, RLHF

Reinforcement learning from human feedback

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-13

Odborná definícia

Význam a odborné vymedzenie pojmu

Reinforcement learning from human feedback, RLHF, je postup prispôsobenia modelu, pri ktorom ľudia poskytujú demonštrácie, preferencie alebo hodnotenia výstupov a z nich sa vytvorí optimalizačný signál. Klasická pipeline zahŕňa supervised fine-tuning, tréning reward modelu z párových porovnaní a následnú optimalizáciu politiky s obmedzením odchýlky od referenčného modelu. RLHF môže zlepšiť nasledovanie pokynov, no zdedí nejednotnosť anotátorov, medzery v pokrytí a zraniteľnosť reward modelu voči overoptimization.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Ľudia nemusia napísať presnú správnu odpoveď pre každý prompt. Môžu porovnať dve odpovede a označiť, ktorá je užitočnejšia, bezpečnejšia alebo lepšie rešpektuje zadanie. Z týchto volieb sa naučí model odmeny a jazykový model sa ďalej trénuje, aby získaval vyššie hodnotenie. Proces vie meniť správanie vo veľkom meradle, ale ľudská preferencia nie je objektívna pravda. Ak sú pravidlá nejasné alebo vzorka úzka, model sa naučí štýl hodnotiteľov namiesto všeobecnej kvality.

Časté otázky

Otázky, ktoré spresňujú význam

Aké kroky tvorí typická RLHF pipeline?

Najprv supervised fine-tuning na kvalitných odpovediach, potom zber párových preferencií, tréning reward modelu a napokon optimalizácia politiky, často s KL penalizáciou.

Je DPO to isté ako RLHF?

DPO využíva preferenčné dáta priamo bez samostatnej on-policy RL slučky a explicitného reward modelu. Patrí do širšej rodiny preference optimization, ale implementačne sa líši.

Prečo sa meria zhoda anotátorov?

Nízka zhoda odhaľuje nejasné kritériá, kultúrne rozdiely alebo ťažké prípady. Bez nej môže reward model predstierať presnosť v oblasti, kde ani ľudia nemajú stabilný konsenzus.

Môže RLHF odstrániť halucinácie?

Nie. Môže znížiť niektoré nežiaduce vzorce a naučiť model priznať neistotu, ale faktická správnosť závisí aj od dát, retrievalu, evaluácie a kontextu.

Čo je reward overoptimization?

Politika začne využívať slabiny reward modelu a zvyšuje jeho skóre bez reálneho zlepšenia ľudskej kvality. Preto sa sledujú nezávislé evaly a obmedzuje veľkosť aktualizácie.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Ouyang et al., Training language models to follow instructions with human feedback, 2022

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.