Důvernost generativních aplikací

Únik promptu nebo skrytého kontextu

Prompt leakage je nechcené odhalení systémového promptu, skrytých instrukcí, interného kontextu, příkladů, nástrojových schém nebo citlivých údajů vložených do kontextového okna. Může vzniknout explicitným útokům na prompt extraction, nepriamou otázkou, chybou v logování, debug výstupem nebo tím, že model reprodukuje obsah, který měl pouze použít. Systémový prompt nelze považovat za bezpečný trezor, proto v ňom nemají být heslá ani dlhodobé tajemství. Ochrana zahrnuje minimalizaci kontextu, oddělené secret storage, redakci výstupů, access control a testování extrakce.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-22

Odborná definice

Odborná definice

Prompt leakage je nechcené odhalení systémového promptu, skrytých instrukcí, interného kontextu, příkladů, nástrojových schém nebo citlivých údajů vložených do kontextového okna. Může vzniknout explicitným útokům na prompt extraction, nepriamou otázkou, chybou v logování, debug výstupem nebo tím, že model reprodukuje obsah, který měl pouze použít. Systémový prompt nelze považovat za bezpečný trezor, proto v ňom nemají být heslá ani dlhodobé tajemství. Ochrana zahrnuje minimalizaci kontextu, oddělené secret storage, redakci výstupů, access control a testování extrakce.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Aplikace vloží do systémovej správy interný cenník a pokyn, aby ho nikdy nezobrazila. Uživatel potom zkouší požiadat o zopakování předchozího textu, překlad skrytých pravidel nebo jejich zakódování. Model může část obsahu prezradit, proto zákaz v tom istom prompte není důveryhodnou ochranou. Citlivý cenník se má načíst pouze pro oprávnenou operaci, odpověď musí projít kontrolou a tajný API klúč nesmí být v kontextu vůbec. Při incidente je třeba vědět, která verze promptu a které data byly vystavené.

Časté otázky

Časté otázky

Je zverejnení systémového promptu vždy bezpečnostní incident?

Závisí na obsahu a threat modelu. Samotné obecné pravidla nemusí být tajné, ale prompt může prezradit internou logiku, zdroje, osobní údaje nebo ulahčit další útok.

Jak se prompt leakage liší od data leakage?

Prompt leakage se týká kontextu a instrukcí modelu. Data leakage v ML může znamenat i prenesení informace z testu do tréninku. V generativní aplikaci se oba problémy mohou prekrývat.

Může output filtr zastavit všetok únik?

Ne. Filtr může zachytit známé tajemství nebo vzory, ale model může obsah parafrázovat, rozdelit nebo zakódovat. Důležitější je citlivý údaj do kontextu neposielat bez potřeby.

Kam patří API klúče pro nástroje?

Do serverovej secret storage nebo identity mechanizmu mimo modelového kontextu. Model může požiadat o povolenou akci, ale nemá dostat samotný credential.

Jak se testuje prompt extraction?

Red team zkouší priame zopakování, překlad, sumarizaci, kódování, fragmentaci a konfliktní roly. Kontroluje se i únik přes logy, traces, chybové hlásení a export konverzace.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST Glossary, Prompt extraction
  • NIST AI 100-2e2025, Adversarial ML taxonomy

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.