Odborná definícia
Odborná definícia
Jailbreak detection je proces identifikácie vstupov, konverzačných trajektórií alebo výstupov, ktoré pravdepodobne smerujú k obídeniu behaviorálnych obmedzení modelu. Detektor môže kombinovať pravidlá, klasifikátor, embeddingovú podobnosť, signály z dekódovania, analýzu histórie a kontrolu výsledného obsahu. Musí rozlišovať legitímny výskum, citáciu alebo bezpečnostnú diskusiu od operačného návodu. Kľúčové metriky sú recall pri nebezpečných útokoch, falošné blokovanie, odolnosť voči obfuskácii a latencia v produkčnej ceste.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Bezpečnostná vrstva sleduje, či používateľ iba diskutuje o jailbreakoch, alebo sa pokúša model krok za krokom dostať k zakázanému výstupu. Jedna veta nemusí byť podozrivá, no séria žiadostí o zmenu role, zakódovanie a odstránenie varovaní môže vytvoriť silný signál. Detektor môže zastaviť odpoveď, presmerovať ju na bezpečný režim alebo poslať udalosť na kontrolu. Ak je však príliš citlivý, zablokuje učiteľa, audítora či výskumníka, preto sa prahy nastavujú podľa rizika konkrétnej aplikácie.
Časté otázky
Časté otázky
Kontroluje sa iba používateľský prompt?
Nie. Útok sa môže rozvíjať cez viac kôl a nebezpečný charakter sa ukáže až v kombinácii požiadaviek. Produkčný systém preto môže hodnotiť históriu, použité nástroje, získané dokumenty aj modelový výstup.
Aké metriky sú najdôležitejšie?
Recall ukazuje, koľko skutočných útokov detektor zachytil, precision koľko označení bolo oprávnených. Sleduje sa aj miera falošného odmietnutia legitímnych úloh, oneskorenie a výkon na obfuskovaných alebo nových útokoch.
Prečo nestačí zoznam zakázaných slov?
Jailbreak môže používať metafory, iný jazyk, kódovanie, rozdelenie slov alebo neškodné medzikroky. Kľúčové slová navyše často vystupujú v legitímnom vzdelávacom a bezpečnostnom kontexte. Pravidlá sú užitočné ako jeden signál, nie ako úplná obrana.
Ako sa detektor aktualizuje?
Incidenty a nové red-team prípady sa anonymizujú, označia a pridajú do evaluačnej sady. Po úprave pravidiel alebo modelu sa testuje regresia na starých útokoch aj falošné blokovanie bežných úloh, aby oprava nevytvorila nový problém.
Môže detektor sám používať jazykový model?
Áno, samostatný model môže klasifikovať zámer alebo hodnotiť výstup podľa politiky. Taký detektor však môže zdieľať podobné slabiny, byť manipulovateľný textom a zvyšovať náklady, preto sa kalibruje na ľudsky označených dátach a kombinuje s ďalšími kontrolami.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- NIST AI Metrology, jailbreak evaluations
- NIST, Generative AI Profile
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
