Bezpečnosť a robustnosť modelov

Universal adversarial perturbation

univerzálna adversariálna perturbácia

Universal adversarial perturbation je jediný malý vzor úpravy vstupu, ktorý po pridaní k veľkému podielu rôznych príkladov spôsobí chybnú predikciu modelu. Na rozdiel od útoku optimalizovaného pre jeden obraz sa perturbácia učí tak, aby fungovala naprieč datasetom alebo triedami. Môže odhaliť spoločné zraniteľné smery rozhodovacej hranice. Úspešnosť závisí od normového obmedzenia, modelu, dát a transferu medzi architektúrami. Vizuálna nenápadnosť neznamená fyzickú realizovateľnosť ani rovnaký dopad v produkcii. Bezpečnostný report musí rozlíšiť digitálny útok, transformovaný vstup a fyzický experiment na reálnom senzore.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-13

Odborná definícia

Odborná definícia

Universal adversarial perturbation je jediný malý vzor úpravy vstupu, ktorý po pridaní k veľkému podielu rôznych príkladov spôsobí chybnú predikciu modelu. Na rozdiel od útoku optimalizovaného pre jeden obraz sa perturbácia učí tak, aby fungovala naprieč datasetom alebo triedami. Môže odhaliť spoločné zraniteľné smery rozhodovacej hranice. Úspešnosť závisí od normového obmedzenia, modelu, dát a transferu medzi architektúrami. Vizuálna nenápadnosť neznamená fyzickú realizovateľnosť ani rovnaký dopad v produkcii. Bezpečnostný report musí rozlíšiť digitálny útok, transformovaný vstup a fyzický experiment na reálnom senzore.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Bežný adversariálny útok vytvorí inú drobnú zmenu pre každý obrázok. Univerzálna perturbácia je skôr ako priehľadná fólia s jedným vzorom, ktorú možno položiť na veľa fotografií a model sa začne systematicky mýliť. To naznačuje, že sieť má spoločné slabé smery, ktoré nie sú viazané na jeden objekt. Pri audite sa skúma nielen percento oklamaných vstupov, ale aj veľkosť zmeny, prenos na iné modely a to, či útok prežije tlač, kameru alebo kompresiu. Obrana sa hodnotí proti adaptívnemu útočníkovi, ktorý pozná predspracovanie a prispôsobí perturbáciu použitej ochrane.

Časté otázky

Časté otázky

Čím sa univerzálna perturbácia líši od patch attacku?

Perturbácia býva rozptýlená po celom vstupe a obmedzená normou. Patch je lokalizovaný viditeľný vzor, ktorý môže mať výraznejšiu amplitúdu na malej ploche.

Musí útočník poznať váhy modelu?

Nie vždy. Perturbácia vytvorená na náhradnom modeli môže prenášať účinok na iné architektúry, hoci úspešnosť black-box útoku býva nižšia.

Ako sa meria sila útoku?

Fooling rate sa uvádza spolu s normou perturbácie, datasetom, typom predspracovania, cieľovým modelom a prípadným požadovaným cieľovým štítkom.

Pomôže adversarial training?

Môže zvýšiť robustnosť voči triede útokov zahrnutej v tréningu, ale nie je univerzálnou zárukou. Treba testovať aj nové normy, transformácie a adaptívne útoky.

Je perturbácia viditeľná človeku?

Môže byť navrhnutá ako vizuálne nenápadná, no percepčná podobnosť závisí od obrazu, displeja a pozorovateľa. Malá matematická norma nie je úplný perceptuálny test.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Universal Adversarial Perturbations
  • NIST, Adversarial Machine Learning taxonomy

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.