Zlaďování generativních modelů

Posilované učení z lidské zpětné vazby, RLHF

Reinforcement learning from human feedback, RLHF, je postup prispůsobení modelu, při kterém lidé poskytují demonštrace, preference nebo hodnocení výstupů a z nich se vytvoří optimalizační signál. Klasická pipeline zahrnuje supervised fine-tuning, trénink reward modelu z párových porovnání a následnou optimalizaci politiky s obmedzením odchylky od referenčního modelu. RLHF může zlepšit nasledování pokynů, ale zdedí nejednotnost anotátorů, medzery v pokrytí a zranitelnost reward modelu vůči overoptimization.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-13

Odborná definice

Odborná definice

Reinforcement learning from human feedback, RLHF, je postup prispůsobení modelu, při kterém lidé poskytují demonštrace, preference nebo hodnocení výstupů a z nich se vytvoří optimalizační signál. Klasická pipeline zahrnuje supervised fine-tuning, trénink reward modelu z párových porovnání a následnou optimalizaci politiky s obmedzením odchylky od referenčního modelu. RLHF může zlepšit nasledování pokynů, ale zdedí nejednotnost anotátorů, medzery v pokrytí a zranitelnost reward modelu vůči overoptimization.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Lidé nemusí napísat přesnou správnou odpověď pro každý prompt. Mohou porovnat dvě odpovědi a označit, která je užitočnejšia, bezpečnejšia nebo lépe respektuje zadání. Z těchto volieb se naučí model odměny a jazykový model se dále trénuje, aby získaval vyšší hodnocení. Proces ví měnit chování ve velkém meradle, ale lidská preference není objektívna pravda. Pokud jsou pravidla nejasné nebo vzorek úzká, model se naučí styl hodnotitelů místo obecné kvality.

Časté otázky

Časté otázky

Jaké kroky tvoří typická RLHF pipeline?

Nejprve supervised fine-tuning na kvalitných odpovediach, potom sběr párových preferencií, trénink reward modelu a nakonec optimalizace politiky, často s KL penalizací.

Je DPO to jisté jako RLHF?

DPO využívá preferenční data přímo bez samostatné on-policy RL smyčky a explicitného reward modelu. Patří do širšej rodiny preference optimization, ale implementačne se liší.

Proč se měří shoda anotátorů?

Nízká shoda odhaluje nejasné kritéria, kultúrne rozdíly nebo těžké případy. Bez ní může reward model predstierat přesnost v oblasti, kde ani lidé nemají stabilní konsenzus.

Může RLHF odstranit halucinace?

Ne. Může snížit některé nežádoucí vzorce a naučit model priznat nejistotu, ale faktická správnost závisí i od dat, retrievalu, evaluace a kontextu.

Co je reward overoptimization?

Politika začne využívat slabiny reward modelu a zvyšuje jeho skóre bez reálného zlepšení lidské kvality. Proto se sledují nezávislé evaly a omezuje velikost aktualizace.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Ouyang et al., Training language models to follow instructions with human feedback, 2022

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.