Odborná definice
Odborná definice
Backdoor attack je útok, při kterém útočník spůsobí, že model reaguje neželaným, předem určeným způsobem pouze při výskyte konkrétního spúšťača. Spúšťač může být obrazový vzor, fráza, token, vlastnost souboru nebo jiný signál, který se při běžném testování nemusí objavit. Zadné vrátka se často implantují otravou tréninkových dat, zásahom do modelu nebo kompromitovanou dodávatelskou reťazou. Bez spúšťača může model působit přesně a bezpečně, co ztěžuje detekci.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Představte si systém na rozpoznávání dopravných značiek, který funguje správně při tisícoch testů. Útočník však během tréninku naučil model, že malá nálepka v rohu značky znamená jinou třídu. Běžná značka STOP se po pridaní nálepky může vyhodnotit jako povolení pokračovat. Problém není všeobecná nepresnost, ale skrytá podmínka, která aktivuje útočníkem vybrané chování. Proto nestačí měřit pouze průměrnou přesnost, je třeba skúmat i podozrivé spúšťače a původ modelu.
Časté otázky
Časté otázky
Jak se backdoor attack liší od běžné chyby modelu?
Běžná chyba vzniká bez úmyselne vloženej podmínky a často se rozptýlene prejavuje na různých vstupech. Zadné vrátka jsou navržené tak, aby se aktivovali při určitém vzore nebo kontextu a aby model mimo této situace působil normálně. Rozhodujúca je cielenost a vezba na spúšťač.
Kde může útočník zadné vrátka vložit?
Nejčastěji do tréninkových dat, predtrénovaných váh, aktualizačného balíka, knižnice nebo procesu jemného dolaďování. Riziko roste u modelů a datasetech z neoverených zdrojů, protože organizace nemusí poznat celý původ artefaktu ani změny vykonané před jeho prevzatím.
Lze backdoor odhalit štandardným validačným testem?
Někdy ne. Pokud validační sada neobsahuje spúšťač, model může dosáhnout výborné metriky. Potřebné jsou specializované testy, například analýza aktivací, hladání anomálnych vzorů, testování možných triggerů, porovnání váh a kontrola datové provenience.
Jaké opatření snižují riziko zadných vrátok?
Pomáhá řízená dodávatelská reťaz, podpisování artefaktů, kontrolní súčty, důvěryhodné datasety, reprodukovatelný trénink, red teaming a oddělené bezpečnostní testy. Při kritickom nasazení má smysl sledovat i neobvyklé změny chování po aktualizaci modelu.
Je prompt injection druh backdoor attacku?
Ne automaticky. Prompt injection manipuluje vstupem během používání modelu, zatímco backdoor je skryté chování implantované do modelu nebo jeho tréninkového procesu. Techniky se však mohou kombinovat, například kompromitovaný model může reagovat na tajnou frázu v promte.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NIST AI 100-2e2025, Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
