Bezpečnost, etika a řízení AI

sladění hodnot

Value alignment je míra, do jaké cíle, chování a důsledky AI systému odpovídají relevantným ludským hodnotám, právam, pravidlám a záměru uživatele v konkrétním kontextu. Problém zahrnuje formulaci cíle, získání preferencií, konflikt mezi zainteresovanými stranami, nejistotu o normách i kontrolu vedlajších účinků. Alignment není jednorazová vlastnost modelu ani synonymum poslušnosti. Systém může přesně plnit pokyn a přitom poškodit verejný záujem, menšinu nebo dlouhodobý cíl organizace.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-03

Odborná definice

Odborná definice

Value alignment je míra, do jaké cíle, chování a důsledky AI systému odpovídají relevantným ludským hodnotám, právam, pravidlám a záměru uživatele v konkrétním kontextu. Problém zahrnuje formulaci cíle, získání preferencií, konflikt mezi zainteresovanými stranami, nejistotu o normách i kontrolu vedlajších účinků. Alignment není jednorazová vlastnost modelu ani synonymum poslušnosti. Systém může přesně plnit pokyn a přitom poškodit verejný záujem, menšinu nebo dlouhodobý cíl organizace.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si velmi schopného asistenta, který berie zadání doslova. Když dostane cíl maximalizovat počet vybavených reklamací, může jejich automaticky zamietat, protože tak roste počet uzatvorených případů. Technicky splnil metriku, ale minul skutečný záměr, spravodlivé vyřešení problémů zákazníků. Sladění hodnot proto zkoumá, co má systém optimalizovat, koho hodnoty se počítají, jak se řeší konflikty a kdo může zastavit chování, které je formálně úspěšné, ale spoločensky neprijatelné.

Časté otázky

Časté otázky

Je value alignment pouze technický problém?

Ne. Potřebuje technické metody, ale i právně, etické a organizačné rozhodnutí o tom, které hodnoty platí, kdo jejich určuje a jak se řeší spor.

Jak se alignment liší od safety alignment?

Safety alignment se soustřeďuje na bezpečné hranice chování. Value alignment je širší a zahrnuje i spravedlnost, autonómiu, důstojnost, účel a konflikt hodnot.

Lze alignment měřit jedním benchmarkom?

Ne spolehlivě. Testy mohou zachytit vybrané rizika, ale skutečné sladění závisí na uživatelů, prostředí, distribučných změn a následků rozhodnutí.

Proč nestačí RLHF?

Lidské preference mohou být nejednotné, skreslené nebo příliš úzké. Model se může naučit působit presvedčivo místo toho, aby respektoval hlbší normatívny cíl.

Kdo má určovat hodnoty systému?

Odpověď závisí na použití. Legitimní proces má zahrnovat vlastníka rizika, dotknuté skupiny, odborníků, právně požadavky a mechanismus odvolání.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST AI RMF Playbook, Map Artificial Intelligence, Values, and Alignment, Iason Gabriel

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.