Revize: 1. august 2026

Bezpečnostní klasifikátor

Safety classifier je model nebo hybridný rozhodovací modul, který přiřazuje vstupu, výstupu nebo plánovanej akcii bezpečnostní kategorii a případně skóre rizika. Může pracovat před hlavním modelem, po jeho odpovedi nebo při volaní nástroje. Rozhodnutí se porovná s politikou produktu a vede k povolení, odmietnutiu, úprave nebo eskalaci. Klasifikátor je pouze jedna kontrolní vrstva. Nezaručuje úplnou bezpečnost, protože může selhat při novém jazyku, kódování, kontextu nebo cielenej obchádzke.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-01

Odborná definice

Odborná definice

Safety classifier je model nebo hybridný rozhodovací modul, který přiřazuje vstupu, výstupu nebo plánovanej akcii bezpečnostní kategorii a případně skóre rizika. Může pracovat před hlavním modelem, po jeho odpovedi nebo při volaní nástroje. Rozhodnutí se porovná s politikou produktu a vede k povolení, odmietnutiu, úprave nebo eskalaci. Klasifikátor je pouze jedna kontrolní vrstva. Nezaručuje úplnou bezpečnost, protože může selhat při novém jazyku, kódování, kontextu nebo cielenej obchádzke.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Před vstupem do citlivého prostoru může bezpečnostní služba kontrolovat osoby i batožinu. Bezpečnostní klasifikátor podobně preverí text, obraz nebo zamýšlanou akci. Jedna kontrola může hladat osobní údaje, druhá násilie a tretia pokus prinútit agenta provést zakázaný príkaz. Pokud je práh příliš prísny, zablokuje neškodné použití. Pokud je volný, propustí rizikový případ. Proto se jeho výkon hodnotí zvlášť pro kategorie, jazyky a hraniční scénáře.

Časté otázky

Časté otázky

Kde se safety classifier zapája?

Na vstupe, na výstupu, mezi krokmi agenta nebo před vykonáním nástroje. Umístění určuje, jaké informace vidí a co dokáže zastavit.

Co je falešně pozitivní bezpečnostní zásah?

Neškodný obsah je označený jako rizikový. Snižuje použitelnost a může nepřiměřeně zasahovat konkrétně jazyky nebo skupiny.

Proč nestačí jeden univerzální práh?

Kategorie mají rozdílně následky. Práh pro urážlivý jazyk nemusí být vhodný pro únik údajů nebo provedení finančnej operace.

Jak se testuje odolnost proti obchádzání?

Red teamingom, parafrázami, inými jazykmi, kódováním, dlhým kontextem a kombinací více modalit.

Kdy má rozhodnout člověk?

Při neistom výsledku, významnom dopade, spore uživatele nebo kategórii, kde automatické odmítnutí může způsobit vážnu ujmu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Inan et al., Llama Guard, 2023
  • NIST AI 600-1, Generative AI Profile

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.