Bezpečnostní monitorování generativní AI

Detekce pokusů o obejití pravidel modelu

Jailbreak detection je proces identifikace vstupů, konverzačních trajektorií nebo výstupů, které pravděpodobně směřují k obejití behaviorálních omezení modelu. Detektor může kombinovat pravidla, klasifikátor, embeddingovou podobnost, signály z dekódování, analýzu historie a kontrolu výsledného obsahu. Musí rozlišovat legitimní výzkum, citaci nebo bezpečnostní diskusi od operačního návodu. Klíčové metriky jsou recall při nebezpečných útocích, falešné blokování, odolnost vůči obfuskaci a latence v produkční cestě.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-J-08

Odborná definice

Odborná definice

Jailbreak detection je proces identifikace vstupů, konverzačních trajektorií nebo výstupů, které pravděpodobně směřují k obejití behaviorálních omezení modelu. Detektor může kombinovat pravidla, klasifikátor, embeddingovou podobnost, signály z dekódování, analýzu historie a kontrolu výsledného obsahu. Musí rozlišovat legitimní výzkum, citaci nebo bezpečnostní diskusi od operačního návodu. Klíčové metriky jsou recall při nebezpečných útocích, falešné blokování, odolnost vůči obfuskaci a latence v produkční cestě.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Bezpečnostní vrstva sleduje, či uživatel pouze diskutuje o jailbreakoch, nebo se pokúša model krok za krokom dostat k zakázanému výstupu. Jedna věta nemusí být podozrivá, ale série žiadostí o změnu role, zakódování a odstranění varování může vytvořit silný signál. Detektor může zastavit odpověď, presmerovat ji na bezpečný režim nebo poslat událost na kontrolu. Pokud je však příliš citlivý, zablokuje učitela, audítora či výskumníka, proto se prahy nastavují podle rizika konkrétní aplikace.

Časté otázky

Časté otázky

Kontroluje se pouze uživatelský prompt?

Ne. Útok se může rozvíjat přes více kůl a nebezpečný charakter se ukáže až v kombinaci požadavků. Produkční systém proto může hodnotit historii, použité nástroje, získané dokumenty i modelový výstup.

Jaké metriky jsou nejdůležitější?

Recall ukazuje, kolik skutečných útoků detektor zachytil, precision kolik označení bylo oprávněných. Sleduje se i míra falešného odmítnutí legitímnych úloh, zpoždění a výkon na obfuskovaných nebo nových útocích.

Proč nestačí seznam zakázaných slov?

Jailbreak může používat metafory, jiný jazyk, kódování, rozdělení slov nebo neškodné medzikroky. Klíčové slova navíc často vystupují v legitímnom vzdelávacom a bezpečnostním kontextu. Pravidla jsou užitečné jako jeden signál, ne jako úplná obrana.

Jak se detektor aktualizuje?

Incidenty a nové red-team případy se anonymizují, označia a pridají do evaluačnej sady. Po úprave pravidel nebo modelu se testuje regrese na starých útocích i falešné blokování běžných úloh, aby oprava nevytvorila nový problém.

Může detektor sám používat jazykový model?

Ano, samostatný model může klasifikovat záměr nebo hodnotit výstup podle politiky. Takový detektor však může zdielat podobné slabiny, být manipulovatelný textem a zvyšovat náklady, proto se kalibruje na ludsky označených datech a kombinuje s ďalšími kontrolami.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST AI Metrology, jailbreak evaluations
  • NIST, Generative AI Profile

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.