Odborná definícia
Odborná definícia
White-box attack je adversariálny útok, pri ktorom útočník pozná alebo môže priamo používať vnútorné informácie cieľového systému, napríklad architektúru, parametre, gradienty, tréningový postup alebo obranné mechanizmy. Táto znalosť umožňuje optimalizovať vstup, poisoning stratégiu alebo extrakčný cieľ priamo voči modelu. V evasion scenári sa často počíta gradient straty podľa vstupu a hľadá sa perturbácia v povolenom priestore. White-box označuje úroveň znalosti a prístupu, nie konkrétny algoritmus ani automaticky najsilnejší realistický útok. Hodnotenie musí uviesť normu, rozpočet, počet krokov a adaptáciu na obranu.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Je to situácia, v ktorej útočník neháda správanie modelu iba z odpovedí. Má jeho výkres, parametre a vie si vypočítať, ktorým smerom treba zmeniť vstup, aby sa zvýšila chyba. Pri obrázku môže gradient ukázať kombináciu drobných zmien pixelov, pri jazykovom systéme môže interný prístup pomôcť hľadať citlivé reprezentácie alebo obchádzať filter. Takýto test predstavuje prísny bezpečnostný scenár, ale musí rešpektovať reálne obmedzenia. Útok bez rozpočtu alebo s informáciami, ktoré nasadený protivník nemôže získať, meria inú hrozbu.
Časté otázky
Časté otázky
Ako sa líši od black-box attack?
Black-box útočník nepozná vnútorné parametre a pracuje s dotazmi, výstupmi alebo náhradným modelom. White-box môže používať gradienty a presnú implementáciu cieľa.
Je FGSM white-box metóda?
V základnej forme áno, pretože používa znamienko gradientu straty podľa vstupu. Rovnaký nápad možno aproximovať aj cez surrogate model, ale potom sa mení znalostný scenár.
Prečo sa testuje aj nereálny plný prístup?
Poskytuje silný diagnostický horný scenár a odhaľuje gradient masking. Ak obrana zlyhá pri správne adaptovanom white-box útoku, nemožno ju považovať za robustnú.
Čo je adaptive attack?
Útočník upraví cieľ, optimalizáciu alebo diferenciáciu tak, aby výslovne zohľadnil konkrétnu obranu. Generický útok môže vyzerať neúspešne iba preto, že obranu nepozná.
Aké údaje má report obsahovať?
Threat model, povolené znalosti, normu perturbácie, epsilon, počet iterácií, restarty, success rate, čistú presnosť a overenie, že optimalizácia nebola umelo zablokovaná.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- NIST AI 100-2 E2025, Adversarial Machine Learning Explaining and Harnessing Adversarial Examples
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
