Odborná definice
Odborná definice
Prompt leakage je nechcené odhalení systémového promptu, skrytých instrukcí, interného kontextu, příkladů, nástrojových schém nebo citlivých údajů vložených do kontextového okna. Může vzniknout explicitným útokům na prompt extraction, nepriamou otázkou, chybou v logování, debug výstupem nebo tím, že model reprodukuje obsah, který měl pouze použít. Systémový prompt nelze považovat za bezpečný trezor, proto v ňom nemají být heslá ani dlhodobé tajemství. Ochrana zahrnuje minimalizaci kontextu, oddělené secret storage, redakci výstupů, access control a testování extrakce.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Aplikace vloží do systémovej správy interný cenník a pokyn, aby ho nikdy nezobrazila. Uživatel potom zkouší požiadat o zopakování předchozího textu, překlad skrytých pravidel nebo jejich zakódování. Model může část obsahu prezradit, proto zákaz v tom istom prompte není důveryhodnou ochranou. Citlivý cenník se má načíst pouze pro oprávnenou operaci, odpověď musí projít kontrolou a tajný API klúč nesmí být v kontextu vůbec. Při incidente je třeba vědět, která verze promptu a které data byly vystavené.
Časté otázky
Časté otázky
Je zverejnení systémového promptu vždy bezpečnostní incident?
Závisí na obsahu a threat modelu. Samotné obecné pravidla nemusí být tajné, ale prompt může prezradit internou logiku, zdroje, osobní údaje nebo ulahčit další útok.
Jak se prompt leakage liší od data leakage?
Prompt leakage se týká kontextu a instrukcí modelu. Data leakage v ML může znamenat i prenesení informace z testu do tréninku. V generativní aplikaci se oba problémy mohou prekrývat.
Může output filtr zastavit všetok únik?
Ne. Filtr může zachytit známé tajemství nebo vzory, ale model může obsah parafrázovat, rozdelit nebo zakódovat. Důležitější je citlivý údaj do kontextu neposielat bez potřeby.
Kam patří API klúče pro nástroje?
Do serverovej secret storage nebo identity mechanizmu mimo modelového kontextu. Model může požiadat o povolenou akci, ale nemá dostat samotný credential.
Jak se testuje prompt extraction?
Red team zkouší priame zopakování, překlad, sumarizaci, kódování, fragmentaci a konfliktní roly. Kontroluje se i únik přes logy, traces, chybové hlásení a export konverzace.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NIST Glossary, Prompt extraction
- NIST AI 100-2e2025, Adversarial ML taxonomy
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
