Bezpečnosť a odolnosť · Bezpečnosť AI

Adversarial attack

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-A-06

Odborná definícia

Význam a odborné vymedzenie pojmu

Adversarial attack je zámerná činnosť útočníka, ktorej cieľom je zmeniť správanie modelu alebo AI systému manipuláciou dát, vstupov, modelových artefaktov, externých zdrojov či prevádzkového prostredia. Útok môže prebiehať počas zberu dát, tréningu, nasadenia alebo inferencie. Medzi ciele patrí zníženie dostupnosti, obídenie detekcie, vynútenie konkrétneho výstupu, extrakcia informácií alebo narušenie integrity systému. Posúdenie preto vždy potrebuje explicitný threat model, ktorý opisuje schopnosti, znalosti a obmedzenia útočníka.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Bežná chyba vzniká náhodou, adversariálny útok je navrhnutý tak, aby model zlyhal v prospech útočníka. Niekto môže pridať do tréningových dát otrávené príklady, upraviť obrázok tak, aby ho klasifikátor zamenil, alebo vložiť škodlivú inštrukciu do dokumentu, ktorý číta agent. Obrana preto nezačína iba pri modeli. Zahŕňa pôvod dát, prístupové práva, validáciu vstupov, izoláciu nástrojov, detekciu anomálií a pripravenú reakciu na incident. Bez tohto širšieho pohľadu môže byť model odolný voči jednému laboratórnemu testu a pritom zraniteľný cez jednoduchú integráciu.

Časté otázky

Otázky, ktoré spresňujú význam

Aké fázy životného cyklu môže adversariálny útok zasiahnuť?

Útok môže ovplyvniť dáta pred tréningom, samotný tréning, distribúciu modelu, API počas inferencie aj externé zdroje používané systémom. Otrava dát sa snaží zmeniť naučené správanie, evasion attack obchádza model pri použití a útok na dodávateľský reťazec môže nahradiť model alebo knižnicu. Každá fáza vyžaduje odlišné kontrolné mechanizmy.

Čo znamená white-box a black-box útok?

Pri white-box útoku pozná útočník architektúru, parametre alebo gradienty modelu. Pri black-box útoku vidí iba vstupy a výstupy služby a model skúma cez dotazy. Medzi nimi existujú grey-box scenáre s čiastočnými znalosťami. Obrana musí vychádzať z realistického predpokladu o tom, čo môže útočník zistiť z dokumentácie, API, únikov alebo verejne dostupného modelu.

Je prompt injection adversariálny útok?

Áno, v agentných a RAG systémoch môže ísť o adversariálnu manipuláciu inštrukcií. Škodlivý text sa snaží presvedčiť model, aby ignoroval nadradené pravidlá, odhalil dáta alebo použil nástroj neželaným spôsobom. Ochrana zahŕňa oddelenie dôveryhodných a nedôveryhodných vstupov, minimálne oprávnenia, potvrdenie citlivých akcií a kontrolu výstupov.

Prečo nestačí testovať iba známymi útokmi?

Útočník sa prispôsobuje obrane a môže zvoliť inú optimalizáciu, rozpočet dotazov alebo fyzické podmienky. Testovanie jednej metódy dokazuje odolnosť iba voči konkrétnemu scenáru. Potrebný je threat model, viac rodín útokov, adaptívny red teaming a meranie degradácie pri rastúcej sile útočníka. Výsledok sa má interpretovať ako obmedzený dôkaz, nie absolútna bezpečnosť.

Ako sa riadi adversariálne riziko v organizácii?

Organizácia vytvorí inventár modelov a dátových tokov, určí možné ciele útočníka, chráni tréningové artefakty a sleduje nezvyčajné dotazy či výstupy. Kritické systémy potrebujú incident response, možnosť rollbacku, rotáciu kľúčov a forenzné logy. Technické testy sa spájajú s kontrolou dodávateľov, zmluvnými požiadavkami a pravidelným prehodnotením hrozieb.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • NIST AI 100-2e2025, Adversarial Machine Learning
  • NIST AI Risk Management Framework

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.