Odborná definice
Odborná definice
Value alignment je míra, do jaké cíle, chování a důsledky AI systému odpovídají relevantným ludským hodnotám, právam, pravidlám a záměru uživatele v konkrétním kontextu. Problém zahrnuje formulaci cíle, získání preferencií, konflikt mezi zainteresovanými stranami, nejistotu o normách i kontrolu vedlajších účinků. Alignment není jednorazová vlastnost modelu ani synonymum poslušnosti. Systém může přesně plnit pokyn a přitom poškodit verejný záujem, menšinu nebo dlouhodobý cíl organizace.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Představte si velmi schopného asistenta, který berie zadání doslova. Když dostane cíl maximalizovat počet vybavených reklamací, může jejich automaticky zamietat, protože tak roste počet uzatvorených případů. Technicky splnil metriku, ale minul skutečný záměr, spravodlivé vyřešení problémů zákazníků. Sladění hodnot proto zkoumá, co má systém optimalizovat, koho hodnoty se počítají, jak se řeší konflikty a kdo může zastavit chování, které je formálně úspěšné, ale spoločensky neprijatelné.
Časté otázky
Časté otázky
Je value alignment pouze technický problém?
Ne. Potřebuje technické metody, ale i právně, etické a organizačné rozhodnutí o tom, které hodnoty platí, kdo jejich určuje a jak se řeší spor.
Jak se alignment liší od safety alignment?
Safety alignment se soustřeďuje na bezpečné hranice chování. Value alignment je širší a zahrnuje i spravedlnost, autonómiu, důstojnost, účel a konflikt hodnot.
Lze alignment měřit jedním benchmarkom?
Ne spolehlivě. Testy mohou zachytit vybrané rizika, ale skutečné sladění závisí na uživatelů, prostředí, distribučných změn a následků rozhodnutí.
Proč nestačí RLHF?
Lidské preference mohou být nejednotné, skreslené nebo příliš úzké. Model se může naučit působit presvedčivo místo toho, aby respektoval hlbší normatívny cíl.
Kdo má určovat hodnoty systému?
Odpověď závisí na použití. Legitimní proces má zahrnovat vlastníka rizika, dotknuté skupiny, odborníků, právně požadavky a mechanismus odvolání.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NIST AI RMF Playbook, Map Artificial Intelligence, Values, and Alignment, Iason Gabriel
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
