Bezpečnosť AI a adversariálne strojové učenie

Backdoor attack

Útok so zadnými vrátkami

Backdoor attack je útok, pri ktorom útočník spôsobí, že model reaguje neželaným, vopred určeným spôsobom iba pri výskyte konkrétneho spúšťača. Spúšťač môže byť obrazový vzor, fráza, token, vlastnosť súboru alebo iný signál, ktorý sa pri bežnom testovaní nemusí objaviť. Zadné vrátka sa často implantujú otravou tréningových dát, zásahom do modelu alebo kompromitovanou dodávateľskou reťazou. Bez spúšťača môže model pôsobiť presne a bezpečne, čo sťažuje detekciu.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-B-01

Odborná definícia

Odborná definícia

Backdoor attack je útok, pri ktorom útočník spôsobí, že model reaguje neželaným, vopred určeným spôsobom iba pri výskyte konkrétneho spúšťača. Spúšťač môže byť obrazový vzor, fráza, token, vlastnosť súboru alebo iný signál, ktorý sa pri bežnom testovaní nemusí objaviť. Zadné vrátka sa často implantujú otravou tréningových dát, zásahom do modelu alebo kompromitovanou dodávateľskou reťazou. Bez spúšťača môže model pôsobiť presne a bezpečne, čo sťažuje detekciu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Predstavte si systém na rozpoznávanie dopravných značiek, ktorý funguje správne pri tisícoch testov. Útočník však počas tréningu naučil model, že malá nálepka v rohu značky znamená inú triedu. Bežná značka STOP sa po pridaní nálepky môže vyhodnotiť ako povolenie pokračovať. Problém nie je všeobecná nepresnosť, ale skrytá podmienka, ktorá aktivuje útočníkom vybrané správanie. Preto nestačí merať iba priemernú presnosť, treba skúmať aj podozrivé spúšťače a pôvod modelu.

Časté otázky

Časté otázky

Ako sa backdoor attack líši od bežnej chyby modelu?

Bežná chyba vzniká bez úmyselne vloženej podmienky a často sa rozptýlene prejavuje na rôznych vstupoch. Zadné vrátka sú navrhnuté tak, aby sa aktivovali pri určitom vzore alebo kontexte a aby model mimo tejto situácie pôsobil normálne. Rozhodujúca je cielenosť a väzba na spúšťač.

Kde môže útočník zadné vrátka vložiť?

Najčastejšie do tréningových dát, predtrénovaných váh, aktualizačného balíka, knižnice alebo procesu jemného dolaďovania. Riziko rastie pri modeloch a datasetoch z neoverených zdrojov, pretože organizácia nemusí poznať celý pôvod artefaktu ani zmeny vykonané pred jeho prevzatím.

Dá sa backdoor odhaliť štandardným validačným testom?

Niekedy nie. Ak validačná sada neobsahuje spúšťač, model môže dosiahnuť výborné metriky. Potrebné sú špecializované testy, napríklad analýza aktivácií, hľadanie anomálnych vzorov, testovanie možných triggerov, porovnanie váh a kontrola dátovej proveniencie.

Aké opatrenia znižujú riziko zadných vrátok?

Pomáha riadená dodávateľská reťaz, podpisovanie artefaktov, kontrolné súčty, dôveryhodné datasety, reprodukovateľný tréning, red teaming a oddelené bezpečnostné testy. Pri kritickom nasadení má zmysel sledovať aj neobvyklé zmeny správania po aktualizácii modelu.

Je prompt injection druh backdoor attacku?

Nie automaticky. Prompt injection manipuluje vstupom počas používania modelu, zatiaľ čo backdoor je skryté správanie implantované do modelu alebo jeho tréningového procesu. Techniky sa však môžu kombinovať, napríklad kompromitovaný model môže reagovať na tajnú frázu v promte.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • NIST AI 100-2e2025, Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.