Odborná definícia
Odborná definícia
Prompt leakage je nechcené odhalenie systémového promptu, skrytých inštrukcií, interného kontextu, príkladov, nástrojových schém alebo citlivých údajov vložených do kontextového okna. Môže vzniknúť explicitným útokom na prompt extraction, nepriamou otázkou, chybou v logovaní, debug výstupom alebo tým, že model reprodukuje obsah, ktorý mal iba použiť. Systémový prompt nemožno považovať za bezpečný trezor, preto v ňom nemajú byť heslá ani dlhodobé tajomstvá. Ochrana zahŕňa minimalizáciu kontextu, oddelené secret storage, redakciu výstupov, access control a testovanie extrakcie.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Aplikácia vloží do systémovej správy interný cenník a pokyn, aby ho nikdy nezobrazila. Používateľ potom skúša požiadať o zopakovanie predchádzajúceho textu, preklad skrytých pravidiel alebo ich zakódovanie. Model môže časť obsahu prezradiť, preto zákaz v tom istom prompte nie je dôveryhodnou ochranou. Citlivý cenník sa má načítať iba pre oprávnenú operáciu, odpoveď musí prejsť kontrolou a tajný API kľúč nesmie byť v kontexte vôbec. Pri incidente treba vedieť, ktorá verzia promptu a ktoré dáta boli vystavené.
Časté otázky
Časté otázky
Je zverejnenie systémového promptu vždy bezpečnostný incident?
Závisí od obsahu a threat modelu. Samotné všeobecné pravidlá nemusia byť tajné, ale prompt môže prezradiť internú logiku, zdroje, osobné údaje alebo uľahčiť ďalší útok.
Ako sa prompt leakage líši od data leakage?
Prompt leakage sa týka kontextu a inštrukcií modelu. Data leakage v ML môže znamenať aj prenesenie informácie z testu do tréningu. V generatívnej aplikácii sa oba problémy môžu prekrývať.
Môže output filter zastaviť všetok únik?
Nie. Filter môže zachytiť známe tajomstvá alebo vzory, ale model môže obsah parafrázovať, rozdeliť alebo zakódovať. Dôležitejšie je citlivý údaj do kontextu neposielať bez potreby.
Kam patria API kľúče pre nástroje?
Do serverovej secret storage alebo identity mechanizmu mimo modelového kontextu. Model môže požiadať o povolenú akciu, ale nemá dostať samotný credential.
Ako sa testuje prompt extraction?
Red team skúša priame zopakovanie, preklad, sumarizáciu, kódovanie, fragmentáciu a konfliktné roly. Kontroluje sa aj únik cez logy, traces, chybové hlásenia a export konverzácie.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- NIST Glossary, Prompt extraction
- NIST AI 100-2e2025, Adversarial ML taxonomy
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
