Bezpečnosť a odolnosť · Bezpečnosť AI

Adversarial example

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-A-07

Odborná definícia

Význam a odborné vymedzenie pojmu

Adversarial example je vstup zámerne vytvorený alebo upravený tak, aby vyvolal chybnú či útočníkom zvolenú reakciu modelu, hoci pre človeka môže pôsobiť nezmenene alebo legitímne. Úprava môže byť digitálna, napríklad malé zmeny pixelov, alebo fyzická, napríklad vzor na objekte snímanom kamerou. Úspešnosť závisí od threat modelu, povoleného rozsahu zásahu, znalosti modelu a podmienok, v ktorých sa vstup spracúva. Pri hodnotení sa uvádza aj to, či perturbácia zachováva sémantický význam a či je uskutočniteľná mimo laboratórnych podmienok.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Na fotografii dopravnej značky možno zmeniť len malé množstvo pixelov tak, že človek stále vidí značku STOP, no model ju označí ako inú kategóriu. V texte môže podobnú úlohu plniť zámerne zostavená formulácia, ktorá obíde klasifikátor alebo bezpečnostný filter. Adversariálny príklad nie je obyčajný zvláštny vstup. Je skonštruovaný s vedomím cieľa a obmedzení tak, aby využil konkrétnu slabinu rozhodovacej hranice modelu. Útočník pritom nemusí meniť veľa, stačí nájsť smer, na ktorý je model citlivejší než človek alebo referenčný proces.

Časté otázky

Otázky, ktoré spresňujú význam

Musí byť adversariálna zmena pre človeka neviditeľná?

Nie. Mnohé výskumné útoky obmedzujú veľkosť perturbácie tak, aby bola takmer nepostrehnuteľná, no praktický útok môže použiť viditeľnú nálepku, tvar, text alebo zvuk. Dôležité je, že zásah rešpektuje schopnosti útočníka a stále vedie k požadovanej chybe. Pri fyzických útokoch sa navyše testuje vzdialenosť, uhol, osvetlenie a kvalita senzora.

Čo je cielený a necielený adversariálny príklad?

Necielený príklad má spôsobiť akúkoľvek nesprávnu predikciu. Cielený príklad má prinútiť model vybrať konkrétnu triedu alebo konkrétny výstup. Cielený útok je zvyčajne náročnejší, ale môže mať väčšiu praktickú hodnotu pre útočníka, napríklad keď chce, aby systém označil škodlivý súbor za bezpečný.

Čo znamená transferabilita adversariálnych príkladov?

Príklad vytvorený proti jednému modelu môže oklamať aj iný model, hoci útočník nepozná jeho parametre. Tento jav umožňuje trénovať náhradný model a použiť ho na black-box útok. Miera prenosu závisí od architektúry, dát, tréningu a typu útoku. Preto utajenie modelu samo osebe nie je spoľahlivou bezpečnostnou kontrolou.

Ako sa adversariálne príklady používajú pri testovaní?

Bezpečnostný tím vytvorí sadu útokov podľa threat modelu, zmeria úspešnosť útoku a sleduje, ako rýchlo klesá kvalita pri rastúcom rozpočte perturbácie. Testovacie príklady sa nesmú zamiešať do bežnej testovacej sady bez označenia. Výsledky sa reportujú oddelene pre čisté vstupy a napadnuté vstupy, aby bolo vidieť kompromis medzi presnosťou a robustnosťou.

Je každý neobvyklý vstup adversariálnym príkladom?

Nie. Neobvyklý alebo mimodistribučný vstup môže vzniknúť bez úmyslu a model na ňom môže zlyhať. Adversariálny príklad predpokladá zámernú konštrukciu smerujúcu k určitému cieľu. V prevádzke však nemusí byť úmysel okamžite známy, preto sa detekcia anomálií, forenzná analýza a incident response používajú aj pri nejasných prípadoch.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • NIST AI 100-2e2025, Adversarial Machine Learning
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.