Bezpečnostné vrstvy generatívnej AI

Safety classifier

Bezpečnostný klasifikátor

Safety classifier je model alebo hybridný rozhodovací modul, ktorý priraďuje vstupu, výstupu alebo plánovanej akcii bezpečnostnú kategóriu a prípadne skóre rizika. Môže pracovať pred hlavným modelom, po jeho odpovedi alebo pri volaní nástroja. Rozhodnutie sa porovná s politikou produktu a vedie k povoleniu, odmietnutiu, úprave alebo eskalácii. Klasifikátor je iba jedna kontrolná vrstva. Nezaručuje úplnú bezpečnosť, pretože môže zlyhať pri novom jazyku, kódovaní, kontexte alebo cielenej obchádzke.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-01

Odborná definícia

Odborná definícia

Safety classifier je model alebo hybridný rozhodovací modul, ktorý priraďuje vstupu, výstupu alebo plánovanej akcii bezpečnostnú kategóriu a prípadne skóre rizika. Môže pracovať pred hlavným modelom, po jeho odpovedi alebo pri volaní nástroja. Rozhodnutie sa porovná s politikou produktu a vedie k povoleniu, odmietnutiu, úprave alebo eskalácii. Klasifikátor je iba jedna kontrolná vrstva. Nezaručuje úplnú bezpečnosť, pretože môže zlyhať pri novom jazyku, kódovaní, kontexte alebo cielenej obchádzke.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Pred vstupom do citlivého priestoru môže bezpečnostná služba kontrolovať osoby aj batožinu. Bezpečnostný klasifikátor podobne preverí text, obraz alebo zamýšľanú akciu. Jedna kontrola môže hľadať osobné údaje, druhá násilie a tretia pokus prinútiť agenta vykonať zakázaný príkaz. Ak je prah príliš prísny, zablokuje neškodné použitie. Ak je voľný, prepustí rizikový prípad. Preto sa jeho výkon hodnotí osobitne pre kategórie, jazyky a hraničné scenáre.

Časté otázky

Časté otázky

Kde sa safety classifier zapája?

Na vstupe, na výstupe, medzi krokmi agenta alebo pred vykonaním nástroja. Umiestnenie určuje, aké informácie vidí a čo dokáže zastaviť.

Čo je falošne pozitívny bezpečnostný zásah?

Neškodný obsah je označený ako rizikový. Znižuje použiteľnosť a môže neprimerane zasahovať konkrétne jazyky alebo skupiny.

Prečo nestačí jeden univerzálny prah?

Kategórie majú rozdielne následky. Prah pre urážlivý jazyk nemusí byť vhodný pre únik údajov alebo vykonanie finančnej operácie.

Ako sa testuje odolnosť proti obchádzaniu?

Red teamingom, parafrázami, inými jazykmi, kódovaním, dlhým kontextom a kombináciou viacerých modalít.

Kedy má rozhodnúť človek?

Pri neistom výsledku, významnom dopade, spore používateľa alebo kategórii, kde automatické odmietnutie môže spôsobiť vážnu ujmu.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Inan et al., Llama Guard, 2023
  • NIST AI 600-1, Generative AI Profile

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.