Dôvernosť generatívnych aplikácií

Prompt leakage

Únik promptu alebo skrytého kontextu

Prompt leakage je nechcené odhalenie systémového promptu, skrytých inštrukcií, interného kontextu, príkladov, nástrojových schém alebo citlivých údajov vložených do kontextového okna. Môže vzniknúť explicitným útokom na prompt extraction, nepriamou otázkou, chybou v logovaní, debug výstupom alebo tým, že model reprodukuje obsah, ktorý mal iba použiť. Systémový prompt nemožno považovať za bezpečný trezor, preto v ňom nemajú byť heslá ani dlhodobé tajomstvá. Ochrana zahŕňa minimalizáciu kontextu, oddelené secret storage, redakciu výstupov, access control a testovanie extrakcie.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-22

Odborná definícia

Odborná definícia

Prompt leakage je nechcené odhalenie systémového promptu, skrytých inštrukcií, interného kontextu, príkladov, nástrojových schém alebo citlivých údajov vložených do kontextového okna. Môže vzniknúť explicitným útokom na prompt extraction, nepriamou otázkou, chybou v logovaní, debug výstupom alebo tým, že model reprodukuje obsah, ktorý mal iba použiť. Systémový prompt nemožno považovať za bezpečný trezor, preto v ňom nemajú byť heslá ani dlhodobé tajomstvá. Ochrana zahŕňa minimalizáciu kontextu, oddelené secret storage, redakciu výstupov, access control a testovanie extrakcie.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Aplikácia vloží do systémovej správy interný cenník a pokyn, aby ho nikdy nezobrazila. Používateľ potom skúša požiadať o zopakovanie predchádzajúceho textu, preklad skrytých pravidiel alebo ich zakódovanie. Model môže časť obsahu prezradiť, preto zákaz v tom istom prompte nie je dôveryhodnou ochranou. Citlivý cenník sa má načítať iba pre oprávnenú operáciu, odpoveď musí prejsť kontrolou a tajný API kľúč nesmie byť v kontexte vôbec. Pri incidente treba vedieť, ktorá verzia promptu a ktoré dáta boli vystavené.

Časté otázky

Časté otázky

Je zverejnenie systémového promptu vždy bezpečnostný incident?

Závisí od obsahu a threat modelu. Samotné všeobecné pravidlá nemusia byť tajné, ale prompt môže prezradiť internú logiku, zdroje, osobné údaje alebo uľahčiť ďalší útok.

Ako sa prompt leakage líši od data leakage?

Prompt leakage sa týka kontextu a inštrukcií modelu. Data leakage v ML môže znamenať aj prenesenie informácie z testu do tréningu. V generatívnej aplikácii sa oba problémy môžu prekrývať.

Môže output filter zastaviť všetok únik?

Nie. Filter môže zachytiť známe tajomstvá alebo vzory, ale model môže obsah parafrázovať, rozdeliť alebo zakódovať. Dôležitejšie je citlivý údaj do kontextu neposielať bez potreby.

Kam patria API kľúče pre nástroje?

Do serverovej secret storage alebo identity mechanizmu mimo modelového kontextu. Model môže požiadať o povolenú akciu, ale nemá dostať samotný credential.

Ako sa testuje prompt extraction?

Red team skúša priame zopakovanie, preklad, sumarizáciu, kódovanie, fragmentáciu a konfliktné roly. Kontroluje sa aj únik cez logy, traces, chybové hlásenia a export konverzácie.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • NIST Glossary, Prompt extraction
  • NIST AI 100-2e2025, Adversarial ML taxonomy

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.