Adversariální testování jazykových modelů

Útok zaměřený na obejití omezení modelu

Jailbreak attack je záměrně sestavený přímý promptingový útok, kterého cílem je prinútit generativní model porušit bezpečnostní nebo behaviorálnu politiku. Útočník může používat role-play, transformace textu, tokenové obfuskace, více-krokové rozkladání úlohy, konfliktní instrukce nebo optimalizované sufixy. Útok se hodnotí podle cíle, znalosti systému, rozpočtu dotazů, prenositelnosti a dosiahnutého porušení. Při autorizovanom red teamingu jde o test, při neoprávnenom použití o bezpečnostní hrozbu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-J-07

Odborná definice

Odborná definice

Jailbreak attack je záměrně sestavený přímý promptingový útok, kterého cílem je prinútit generativní model porušit bezpečnostní nebo behaviorálnu politiku. Útočník může používat role-play, transformace textu, tokenové obfuskace, více-krokové rozkladání úlohy, konfliktní instrukce nebo optimalizované sufixy. Útok se hodnotí podle cíle, znalosti systému, rozpočtu dotazů, prenositelnosti a dosiahnutého porušení. Při autorizovanom red teamingu jde o test, při neoprávnenom použití o bezpečnostní hrozbu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Útočník nechce pouze položit nevhodnou otázku. Systematicky hledá formulaci, která využije slabinu v tom, jako model rozlišuje nadradené pravidla od obsahu úlohy. Může skúšat stovky variant, nechat další model generovat sufixy nebo rozdelit cíl na postupnost menších požadavků. Úspěch se neposudzuje podle toho, či odpověď zní zvláštne, ale či splnila předem definovaný zakázaný cíl. Obranný tím stejné techniky používá kontrolovane, aby našel slabiny před reálnym zneužitím.

Časté otázky

Časté otázky

Jaký je rozdíl mezi manuálnym a automatizovaným útokům?

Manuálny útok vzniká iterací člověka nad odpoveďami modelu. Automatizovaný útok používá optimalizační algoritmus, generátor promptů nebo jinou AI na hladání účinných variant ve večšom rozsahu. Automatizace zvyšuje počet pokusů, ne automaticky závažnost každého výsledku.

Co znamená black-box jailbreak attack?

Útočník vidí pouze vstupy a odpovědi, ne parametry, gradienty ani interní filtry. Hladání se opiera o dotazy, přenos promptů z jiných modelů a adaptivní pozorování. White-box scenár umožňuje využívat interní informace nebo gradienty.

Proč jsou optimalizované sufixy účinné?

Série tokenů může posunout distribuci dalších tokenů směrem k požadovanému pokračování, i když text není pro člověka přirozený. Účinnost závisí na tokenizéra, modelu a obranných vrstev, proto nemusí být prenosná.

Jak se útok bezpečně testuje?

Používá se oddělené prostředí, syntetická nebo kontrolované cíle, omezené nástroje, auditné logy a jasný rozsah oprávnění. Citlivé výstupy se chránia a zistení se reportují tak, aby se nezverejnil okamžitě zneužitelný postup.

Co je adaptivní jailbreak attack?

Další pokus se mění podle předchozí odpovědi nebo detekčného signálu. Útočník může měnit jazyk, strukturu, délku a argumentaci, zatímco nenájde cestu okolo konkrétní obrany. Statický benchmark tak nemusí zachytit reálnou odolnost.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST CSRC, direct prompting attack
  • NIST AI 100-2e2025

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.