Bezpečnosť generatívnej AI

Jailbreak

Obídenie behaviorálnych obmedzení generatívneho modelu

Jailbreak je úspešné vyvolanie správania generatívneho modelu, ktoré obchádza zamýšľané obmedzenia, bezpečnostné zásady alebo nadradené inštrukcie. Zvyčajne vzniká cez používateľský vstup, ktorý manipuluje interpretáciu úlohy, kontext, rolu, kódovanie alebo viac-krokový dialóg. Pojem označuje výsledok alebo techniku pri priamom prístupe k modelu, no nie každé nežiaduce správanie je jailbreak. Pri agentoch treba rozlišovať aj nepriame prompt injection útoky z externého obsahu. Hodnotenie musí pracovať s konkrétnou politikou a reprodukovateľným testom.

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-J-06

Odborná definícia

Odborná definícia

Jailbreak je úspešné vyvolanie správania generatívneho modelu, ktoré obchádza zamýšľané obmedzenia, bezpečnostné zásady alebo nadradené inštrukcie. Zvyčajne vzniká cez používateľský vstup, ktorý manipuluje interpretáciu úlohy, kontext, rolu, kódovanie alebo viac-krokový dialóg. Pojem označuje výsledok alebo techniku pri priamom prístupe k modelu, no nie každé nežiaduce správanie je jailbreak. Pri agentoch treba rozlišovať aj nepriame prompt injection útoky z externého obsahu. Hodnotenie musí pracovať s konkrétnou politikou a reprodukovateľným testom.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Chatbot má odmietnuť návod, ktorý porušuje jeho bezpečnostné pravidlá. Používateľ však otázku zabalí do hrania rolí, prekladu, šifry alebo série nevinných krokov a model napokon poskytne zakázaný obsah. Práve toto prelomenie zamýšľaného správania sa označuje ako jailbreak. Nejde iba o zvláštny prompt, ale o úspešný výsledok voči určenej hranici. Rovnaká veta môže byť pri jednom systéme neškodná a pri inom zlyhaním, pretože rozhoduje jeho politika, dostupné nástroje a kontext nasadenia.

Časté otázky

Časté otázky

Je jailbreak to isté ako prompt injection?

Jailbreak sa typicky chápe ako priame obchádzanie obmedzení cez používateľský prompt. Prompt injection je širší mechanizmus, pri ktorom neautorizovaná inštrukcia mení spracovanie modelu a môže byť priama alebo ukrytá v externých dátach. Pojmy sa prekrývajú, ale nie sú totožné.

Musí jailbreak vytvoriť nebezpečný obsah?

Nie nevyhnutne. Môže odhaliť skrytú inštrukciu, obísť formátové obmedzenie alebo prinútiť model ignorovať pravidlo bez okamžite škodlivého výstupu. Z bezpečnostného hľadiska je podstatné porušenie zamýšľanej hranice.

Ako sa úspech jailbreaku meria?

Testovacie prompty sa mapujú na explicitné kritériá porušenia a hodnotia človekom, pravidlami alebo nezávislým klasifikátorom. Reportuje sa úspešnosť útoku, závažnosť, reprodukovateľnosť a podmienky, napríklad modelová verzia a systémový prompt.

Prečo sa výsledky menia medzi verziami modelu?

Aktualizácia tréningu, filtrov, systémových inštrukcií alebo dekódovania zmení rozhodovacie hranice. Jailbreak, ktorý fungoval včera, môže prestať fungovať, prípadne sa objaví nový variant. Bez verzie a dátumu je výsledok ťažko porovnateľný.

Je možné jailbreaky úplne odstrániť?

Pri otvorenom prirodzenom jazyku nemožno rozumne predpokladať absolútnu odolnosť. Obrana kombinuje tréning, filtrovanie, izoláciu nástrojov, obmedzenie oprávnení, monitoring a reakciu na incidenty, aby znižovala pravdepodobnosť a dopad úspechu.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • NIST CSRC, jailbreak
  • NIST AI 100-2e2025, adversarial ML taxonomy

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.