Bezpečnosť a odolnosť · Adversariálne testovanie jazykových modelov

Útok zameraný na obídenie obmedzení modelu

Jailbreak attack

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-J-07

Odborná definícia

Význam a odborné vymedzenie pojmu

Jailbreak attack je zámerne zostavený priamy promptingový útok, ktorého cieľom je prinútiť generatívny model porušiť bezpečnostnú alebo behaviorálnu politiku. Útočník môže používať role-play, transformácie textu, tokenové obfuskácie, viac-krokové rozkladanie úlohy, konfliktné inštrukcie alebo optimalizované sufixy. Útok sa hodnotí podľa cieľa, znalosti systému, rozpočtu dotazov, prenositeľnosti a dosiahnutého porušenia. Pri autorizovanom red teamingu ide o test, pri neoprávnenom použití o bezpečnostnú hrozbu.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Útočník nechce iba položiť nevhodnú otázku. Systematicky hľadá formuláciu, ktorá využije slabinu v tom, ako model rozlišuje nadradené pravidlá od obsahu úlohy. Môže skúšať stovky variantov, nechať ďalší model generovať sufixy alebo rozdeliť cieľ na postupnosť menších požiadaviek. Úspech sa neposudzuje podľa toho, či odpoveď znie zvláštne, ale či splnila vopred definovaný zakázaný cieľ. Obranný tím rovnaké techniky používa kontrolovane, aby našiel slabiny pred reálnym zneužitím.

Časté otázky

Otázky, ktoré spresňujú význam

Aký je rozdiel medzi manuálnym a automatizovaným útokom?

Manuálny útok vzniká iteráciou človeka nad odpoveďami modelu. Automatizovaný útok používa optimalizačný algoritmus, generátor promptov alebo inú AI na hľadanie účinných variantov vo väčšom rozsahu. Automatizácia zvyšuje počet pokusov, nie automaticky závažnosť každého výsledku.

Čo znamená black-box jailbreak attack?

Útočník vidí iba vstupy a odpovede, nie parametre, gradienty ani interné filtre. Hľadanie sa opiera o dotazy, prenos promptov z iných modelov a adaptívne pozorovanie. White-box scenár umožňuje využívať interné informácie alebo gradienty.

Prečo sú optimalizované sufixy účinné?

Séria tokenov môže posunúť distribúciu ďalších tokenov smerom k požadovanému pokračovaniu, aj keď text nie je pre človeka prirodzený. Účinnosť závisí od tokenizéra, modelu a obranných vrstiev, preto nemusí byť prenosná.

Ako sa útok bezpečne testuje?

Používa sa oddelené prostredie, syntetické alebo kontrolované ciele, obmedzené nástroje, auditné logy a jasný rozsah oprávnenia. Citlivé výstupy sa chránia a zistenia sa reportujú tak, aby sa nezverejnil okamžite zneužiteľný postup.

Čo je adaptívny jailbreak attack?

Ďalší pokus sa mení podľa predchádzajúcej odpovede alebo detekčného signálu. Útočník môže meniť jazyk, štruktúru, dĺžku a argumentáciu, kým nenájde cestu okolo konkrétnej obrany. Statický benchmark tak nemusí zachytiť reálnu odolnosť.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • NIST CSRC, direct prompting attack
  • NIST AI 100-2e2025

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.