Odborná definice
Odborná definice
Adversarial example je vstup záměrně vytvořený nebo upravený tak, aby vyvolal chybnou či útočníkem zvolenou reakci modelu, ačkoli pro člověka může působit nezměněně nebo legitimně. Úprava může být digitální, například malé změny pixelů, nebo fyzická, například vzor na objektu snímaném kamerou. Úspěšnost závisí na threat modelu, povoleném rozsahu zásahu, znalosti modelu a podmínek, ve kterých se vstup zpracovává. Při hodnocení se uvádí i to, či perturbace zachovává sémantický význam a zda je proveditelná mimo laboratorní podmínky.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Na fotografii dopravní značky lze změnit jen malé množství pixelů tak, že člověk stále vidí značku STOP, ale model ji označí jako jinou kategorii. V textu může podobnou úlohu plnit záměrně sestavená formulace, která obejde klasifikátor nebo bezpečnostní filtr. Adversariální příklad není obyčejný zvláštní vstup. Je zkonstruovaný s vědomím cíle a omezení tak, aby využil konkrétní slabinu rozhodovací hranice modelu. Útočník přitom nemusí měnit mnoho, stačí najít směr, na který je model citlivější než člověk nebo referenční proces.
Časté otázky
Časté otázky
Musí být adversariální změna pro člověka neviditelná?
Ne. Mnohé výskumné útoky obmedzují velikost perturbace tak, aby byla téměř nepostrehnutelná, ale praktický útok může použít viditelnou nálepku, tvar, text nebo zvuk. Důležité je, že zásah respektuje schopnosti útočníka a stále vede k požadované chybě. Při fyzických útocích se navíc testuje vzdálenost, uhol, osvetlení a kvalita senzora.
Co je cielený a necielený adversariální příklad?
Necielený příklad má způsobit akúkolvek nesprávnu predikci. Cielený příklad má prinútit model vybrat konkrétní třídu nebo konkrétní výstup. Cielený útok je obvykle náročnejší, ale může mít větší praktickou hodnotu pro útočníka, například když chce, aby systém označil škodlivý soubor za bezpečný.
Co znamená transferabilita adversariálnych příkladů?
Příklad vytvořený proti jednomu modelu může oklamat i jiný model, ačkoli útočník nepozná jeho parametry. Tento jev umožňuje trénovat náhradný model a použít ho na black-box útok. Míra přenosu závisí na architektury, dat, tréninku a typu útoku. Proto utajení modelu samo sám o sobě není spolehlivou bezpečnostnou kontrolou.
Jak se adversariální příklady používají při testování?
Bezpečnostní tím vytvoří sadu útoků podle threat modelu, změří úspěšnost útoku a sleduje, jako rychle klesá kvalita při rastúcom rozpočte perturbace. Testovací příklady se nesmějí zamiešat do běžné testovací sady bez označení. Výsledky se reportují odděleně pro čisté vstupy a napadnuté vstupy, aby bylo vidět kompromis mezi přesností a robustností.
Je každý neobvyklý vstup adversariálnym příkladem?
Ne. Neobvyklý nebo mimodistribučný vstup může vzniknout bez úmyslu a model na ňom může selhat. Adversariální příklad předpokládá zámernou konštrukci smerujúcu k určitému cielu. V provozu však nemusí být úmysel okamžitě známy, proto se detekce anomálií, forenzná analýza a incident response používají i při nejasných případech.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NIST AI 100-2e2025, Adversarial Machine Learning
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
