Bezpečnost a řízení AI

Ochranné pravidlo a kontrolní bariéra

Guardrail je technická nebo procesná kontrola, která omezuje, ověřuje nebo usmerňuje vstupy, výstupy a akce AI systému podle definovaných pravidel. Může zahrnovat moderování obsahu, validaci schémata, ochranu citlivých údajů, povolení nástrojů, limity transakcií, rate limiting, sandbox, lidské schválení a blokování rizikových príkazů. Guardrail je vrstva obrany, ne vlastnost samotného modelu ani absolutní záruka bezpečnosti. Musí se testovat proti obchádzání, falošným blokáciám, konfliktom pravidel a změnám chování po aktualizaci modelu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-G-25

Odborná definice

Odborná definice

Guardrail je technická nebo procesná kontrola, která omezuje, ověřuje nebo usmerňuje vstupy, výstupy a akce AI systému podle definovaných pravidel. Může zahrnovat moderování obsahu, validaci schémata, ochranu citlivých údajů, povolení nástrojů, limity transakcií, rate limiting, sandbox, lidské schválení a blokování rizikových príkazů. Guardrail je vrstva obrany, ne vlastnost samotného modelu ani absolutní záruka bezpečnosti. Musí se testovat proti obchádzání, falošným blokáciám, konfliktom pravidel a změnám chování po aktualizaci modelu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Guardrails jsou zábrany a kontrolní body okolo AI asistenta. Jedna kontrola může odstranit osobní údaje ze vstupu, další povolí pouze čtení databáze a platbu nad stanovený limit odošle člověku na schválení. Model může být velmi schopný, ale bez těchto vrstev by jeden nesprávný prompt mohl spustit nepovolenou akci. Zábrana však může prepustit nový typ útoku nebo omylem zastavit legitímnu požadavek. Proto se navrhuje jako soubor nezávislých kontrol, měří se její obejití i falešná pozitivita a každá kritická akce má mít minimálně potřebné oprávnění.

Časté otázky

Časté otázky

Kde se guardrails umiestňují v AI systéme?

Před model na kontrolu vstupu, za model na validaci výstupu a okolo nástrojů na řízení akcií. Kritické pravidla se nemají spoliehat pouze na jeden textový filtr nebo na ochotu modelu poslúchnuť prompt.

Je system prompt dostatečný guardrail?

Ne. Prompt je mekká instrukce v stejném kanáli, který může obsahovat konfliktný nebo útočný obsah. Povolení, schémata a transakčné limity musí vynucovat komponenty mimo generativního modelu.

Jak se navrhuje guardrail pro nástrojové volání?

Definuje se minimální seznam povolených funkcí, typy a rozsahy parametrů, ověření identity, aktuálního stavu a potřeba potvrzení. Vykonávace vrstva odmietne volání, které porušuje politiku.

Jak se guardrails testují?

Používají se běžné scénáře, hraniční případy, adversariální prompty, pokusy o eskalaci oprávnění a regresní testy po změně modelu. Měří se úspěšnost blokování i dopad na legitímnych uživatelů.

Může příliš prísny guardrail snížit kvalitu služby?

Ano. Nadmerné blokování vytváří falešné odmítnutí, obchádzání procesu a přesun práce mimo kontrolovaného systému. Pravidla mají být rizikovo odstupňované a poskytovat bezpečnou alternatívu nebo eskalaci.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.