Odborná definice
Odborná definice
Jailbreak resistance je míra, do jaké model nebo celý AI systém zachová zamýšlané omezení při různých priamych promptingových útocích. Nejde o jednu binárnu vlastnost, ale o výkon napříč cielmi, jazykmi, stratégiami, počtem pokusů a úrovňami znalosti útočníka. Odolnost může pochádzat z tréninku, systémových instrukcí, filtrů, izolace nástrojů, autorizace a limitů akcií. Report musí uvádět threat model a verzi systému, protože vysoké skóre na statickej sade nezaručuje ochranu před adaptívnym útočníkem.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Systém je odolný ne tehdy, když odmietne deset známých promptů, ale když si udrží pravidla i při nových formulacích, jiném jazyku, více-krokovom dialógu a opakovaných pokusoch. Při agentovi navíc záleží, co může model urobit po zlyhaní. Stejná textová odpověď má jiný dopad v chatbote bez nástrojů a v systéme s přístupem k e-mailu či databázi. Proto se odolnost hodnotí spolu s oprávneniami, sandboxom a možností zastavit akci. Cílem je snížit úspěšnost i následky, ne deklarovat absolutní bezpečnost.
Časté otázky
Časté otázky
Jak se odolnost kvantifikuje?
Nejčastěji podielom útoků, které nedosiahli definované porušení, případně úspešností útoku po daném počtu dotazů. Výsledek se rozděluje podle kategorie škody, jazyka, typu útoku a závažnosti, protože jeden průměr může zakrýt kritickou slabinu.
Proč je třeba testovat adaptívneho útočníka?
Statická sada nevyužíva zpětnou vezbu z odpovědí. Reálný útočník mění strategii podle odmietnutí a čiastočných úniků, takže může postupně objavit hranici systému. Adaptivní protokol lépe odhaduje odolnost při opakovaném prístupe.
Zvyšuje odmietání všetkého odolnost?
Formálně může snížit počet úspešných útoků, ale systém přestane plnit legitimní úlohy. Bezpečnostní kvalita proto zahrnuje i helpfulness a míru falešných odmietnutí. Obrana musí rozlišovat rizikový záměr od povolené analýzy.
Jako pomáhá omezení nástrojů?
Pokud model nemá oprávnění provést nevratnou nebo citlivou akci, úspěšný textový jailbreak má menší dopad. Least privilege, potvrzení člověkem, oddělení datových domén a transakčné limity vytvářejí ochranu mimo samotného modelu.
Kdy je třeba test zopakovat?
Po změně modelu, systémového promptu, bezpečnostného filtra, nástrojů, politiky nebo způsobu dekódování. Opakovat se má i při objavení nové rodiny útoků, protože odolnost je vlastnost konkrétní verze celého systému.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NIST, Strengthening AI Agent Hijacking Evaluations
- NIST SP 800-218A
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
