Bezpečnost a robustnost modelů

univerzální adversariální perturbace

Universal adversarial perturbation je jediný malý vzor úpravy vstupu, který po pridaní k velkému podielu různých příkladů spůsobí chybnou predikci modelu. Na rozdíl od útoku optimalizovaného pro jeden obraz se perturbace učí tak, aby fungovala napříč datasetem nebo třídami. Může odhalit společné zranitelné směry rozhodovací hranice. Úspěšnost závisí na normového omezení, modelu, dat a transferu mezi architektúrami. Vizuální nenápadnost neznamená fyzickou realizovatelnost ani stejný dopad v produkci. Bezpečnostní report musí rozlíšit digitální útok, transformovaný vstup a fyzický experiment na reálném senzore.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-13

Odborná definice

Odborná definice

Universal adversarial perturbation je jediný malý vzor úpravy vstupu, který po pridaní k velkému podielu různých příkladů spůsobí chybnou predikci modelu. Na rozdíl od útoku optimalizovaného pro jeden obraz se perturbace učí tak, aby fungovala napříč datasetem nebo třídami. Může odhalit společné zranitelné směry rozhodovací hranice. Úspěšnost závisí na normového omezení, modelu, dat a transferu mezi architektúrami. Vizuální nenápadnost neznamená fyzickou realizovatelnost ani stejný dopad v produkci. Bezpečnostní report musí rozlíšit digitální útok, transformovaný vstup a fyzický experiment na reálném senzore.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Běžný adversariální útok vytvoří jinou drobnou změnu pro každý obrázek. Univerzální perturbace je dříve jako priehladná fólia s jedním vzorom, kterou lze položit na mnoho fotografií a model se začne systematicky mýliť. To naznačuje, že síť má společné slabé směry, které nejsou viazané na jeden objekt. Při auditu se zkoumá nejen percento oklamaných vstupů, ale i velikost změny, přenos na jiné modely a to, či útok prežije tlač, kameru nebo kompresi. Obrana se hodnotí proti adaptívnemu útočníkovi, který pozná předzpracování a prispůsobí perturbaci použitej ochrane.

Časté otázky

Časté otázky

Čím se univerzální perturbace liší od patch attacku?

Perturbace bývá rozptýlená po celém vstupe a omezená normou. Patch je lokalizovaný viditelný vzor, který může mít výraznejšiu amplitúdu na malé ploche.

Musí útočník poznat váhy modelu?

Ne vždy. Perturbace vytvořená na náhradnom modeli může prenášat účinek na jiné architektury, ačkoli úspěšnost black-box útoku bývá nižší.

Jak se měří síla útoku?

Fooling rate se uvádí spolu s normou perturbace, datasetem, typem předzpracování, cielovým modelem a prípadným požadovaným cielovým štítkem.

Pomůže adversarial training?

Může zvýšit robustnost vůči třídě útoků zahrnutej v tréninku, ale není univerzálnou zárukou. Je třeba testovat i nové normy, transformace a adaptivní útoky.

Je perturbace viditelná člověku?

Může být navržená jako vizuálně nenápadná, ale percepčná podobnost závisí na obrazu, displeja a pozorovatela. Malá matematická norma není úplný perceptuálny test.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Universal Adversarial Perturbations
  • NIST, Adversarial Machine Learning taxonomy

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.