Odborná definice
Odborná definice
Jailbreak detection je proces identifikace vstupů, konverzačních trajektorií nebo výstupů, které pravděpodobně směřují k obejití behaviorálních omezení modelu. Detektor může kombinovat pravidla, klasifikátor, embeddingovou podobnost, signály z dekódování, analýzu historie a kontrolu výsledného obsahu. Musí rozlišovat legitimní výzkum, citaci nebo bezpečnostní diskusi od operačního návodu. Klíčové metriky jsou recall při nebezpečných útocích, falešné blokování, odolnost vůči obfuskaci a latence v produkční cestě.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Bezpečnostní vrstva sleduje, či uživatel pouze diskutuje o jailbreakoch, nebo se pokúša model krok za krokom dostat k zakázanému výstupu. Jedna věta nemusí být podozrivá, ale série žiadostí o změnu role, zakódování a odstranění varování může vytvořit silný signál. Detektor může zastavit odpověď, presmerovat ji na bezpečný režim nebo poslat událost na kontrolu. Pokud je však příliš citlivý, zablokuje učitela, audítora či výskumníka, proto se prahy nastavují podle rizika konkrétní aplikace.
Časté otázky
Časté otázky
Kontroluje se pouze uživatelský prompt?
Ne. Útok se může rozvíjat přes více kůl a nebezpečný charakter se ukáže až v kombinaci požadavků. Produkční systém proto může hodnotit historii, použité nástroje, získané dokumenty i modelový výstup.
Jaké metriky jsou nejdůležitější?
Recall ukazuje, kolik skutečných útoků detektor zachytil, precision kolik označení bylo oprávněných. Sleduje se i míra falešného odmítnutí legitímnych úloh, zpoždění a výkon na obfuskovaných nebo nových útocích.
Proč nestačí seznam zakázaných slov?
Jailbreak může používat metafory, jiný jazyk, kódování, rozdělení slov nebo neškodné medzikroky. Klíčové slova navíc často vystupují v legitímnom vzdelávacom a bezpečnostním kontextu. Pravidla jsou užitečné jako jeden signál, ne jako úplná obrana.
Jak se detektor aktualizuje?
Incidenty a nové red-team případy se anonymizují, označia a pridají do evaluačnej sady. Po úprave pravidel nebo modelu se testuje regrese na starých útocích i falešné blokování běžných úloh, aby oprava nevytvorila nový problém.
Může detektor sám používat jazykový model?
Ano, samostatný model může klasifikovat záměr nebo hodnotit výstup podle politiky. Takový detektor však může zdielat podobné slabiny, být manipulovatelný textem a zvyšovat náklady, proto se kalibruje na ludsky označených datech a kombinuje s ďalšími kontrolami.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NIST AI Metrology, jailbreak evaluations
- NIST, Generative AI Profile
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
