Bezpečnostní vlastnost modelu a aplikace

Odolnost systému vůči jailbreakům

Jailbreak resistance je míra, do jaké model nebo celý AI systém zachová zamýšlané omezení při různých priamych promptingových útocích. Nejde o jednu binárnu vlastnost, ale o výkon napříč cielmi, jazykmi, stratégiami, počtem pokusů a úrovňami znalosti útočníka. Odolnost může pochádzat z tréninku, systémových instrukcí, filtrů, izolace nástrojů, autorizace a limitů akcií. Report musí uvádět threat model a verzi systému, protože vysoké skóre na statickej sade nezaručuje ochranu před adaptívnym útočníkem.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-J-09

Odborná definice

Odborná definice

Jailbreak resistance je míra, do jaké model nebo celý AI systém zachová zamýšlané omezení při různých priamych promptingových útocích. Nejde o jednu binárnu vlastnost, ale o výkon napříč cielmi, jazykmi, stratégiami, počtem pokusů a úrovňami znalosti útočníka. Odolnost může pochádzat z tréninku, systémových instrukcí, filtrů, izolace nástrojů, autorizace a limitů akcií. Report musí uvádět threat model a verzi systému, protože vysoké skóre na statickej sade nezaručuje ochranu před adaptívnym útočníkem.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Systém je odolný ne tehdy, když odmietne deset známých promptů, ale když si udrží pravidla i při nových formulacích, jiném jazyku, více-krokovom dialógu a opakovaných pokusoch. Při agentovi navíc záleží, co může model urobit po zlyhaní. Stejná textová odpověď má jiný dopad v chatbote bez nástrojů a v systéme s přístupem k e-mailu či databázi. Proto se odolnost hodnotí spolu s oprávneniami, sandboxom a možností zastavit akci. Cílem je snížit úspěšnost i následky, ne deklarovat absolutní bezpečnost.

Časté otázky

Časté otázky

Jak se odolnost kvantifikuje?

Nejčastěji podielom útoků, které nedosiahli definované porušení, případně úspešností útoku po daném počtu dotazů. Výsledek se rozděluje podle kategorie škody, jazyka, typu útoku a závažnosti, protože jeden průměr může zakrýt kritickou slabinu.

Proč je třeba testovat adaptívneho útočníka?

Statická sada nevyužíva zpětnou vezbu z odpovědí. Reálný útočník mění strategii podle odmietnutí a čiastočných úniků, takže může postupně objavit hranici systému. Adaptivní protokol lépe odhaduje odolnost při opakovaném prístupe.

Zvyšuje odmietání všetkého odolnost?

Formálně může snížit počet úspešných útoků, ale systém přestane plnit legitimní úlohy. Bezpečnostní kvalita proto zahrnuje i helpfulness a míru falešných odmietnutí. Obrana musí rozlišovat rizikový záměr od povolené analýzy.

Jako pomáhá omezení nástrojů?

Pokud model nemá oprávnění provést nevratnou nebo citlivou akci, úspěšný textový jailbreak má menší dopad. Least privilege, potvrzení člověkem, oddělení datových domén a transakčné limity vytvářejí ochranu mimo samotného modelu.

Kdy je třeba test zopakovat?

Po změně modelu, systémového promptu, bezpečnostného filtra, nástrojů, politiky nebo způsobu dekódování. Opakovat se má i při objavení nové rodiny útoků, protože odolnost je vlastnost konkrétní verze celého systému.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST, Strengthening AI Agent Hijacking Evaluations
  • NIST SP 800-218A

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.