Adversariálne strojové učenie a bezpečnosť

White-box attack

útok s úplnou znalosťou cieľového modelu

White-box attack je adversariálny útok, pri ktorom útočník pozná alebo môže priamo používať vnútorné informácie cieľového systému, napríklad architektúru, parametre, gradienty, tréningový postup alebo obranné mechanizmy. Táto znalosť umožňuje optimalizovať vstup, poisoning stratégiu alebo extrakčný cieľ priamo voči modelu. V evasion scenári sa často počíta gradient straty podľa vstupu a hľadá sa perturbácia v povolenom priestore. White-box označuje úroveň znalosti a prístupu, nie konkrétny algoritmus ani automaticky najsilnejší realistický útok. Hodnotenie musí uviesť normu, rozpočet, počet krokov a adaptáciu na obranu.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-20

Odborná definícia

Odborná definícia

White-box attack je adversariálny útok, pri ktorom útočník pozná alebo môže priamo používať vnútorné informácie cieľového systému, napríklad architektúru, parametre, gradienty, tréningový postup alebo obranné mechanizmy. Táto znalosť umožňuje optimalizovať vstup, poisoning stratégiu alebo extrakčný cieľ priamo voči modelu. V evasion scenári sa často počíta gradient straty podľa vstupu a hľadá sa perturbácia v povolenom priestore. White-box označuje úroveň znalosti a prístupu, nie konkrétny algoritmus ani automaticky najsilnejší realistický útok. Hodnotenie musí uviesť normu, rozpočet, počet krokov a adaptáciu na obranu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Je to situácia, v ktorej útočník neháda správanie modelu iba z odpovedí. Má jeho výkres, parametre a vie si vypočítať, ktorým smerom treba zmeniť vstup, aby sa zvýšila chyba. Pri obrázku môže gradient ukázať kombináciu drobných zmien pixelov, pri jazykovom systéme môže interný prístup pomôcť hľadať citlivé reprezentácie alebo obchádzať filter. Takýto test predstavuje prísny bezpečnostný scenár, ale musí rešpektovať reálne obmedzenia. Útok bez rozpočtu alebo s informáciami, ktoré nasadený protivník nemôže získať, meria inú hrozbu.

Časté otázky

Časté otázky

Ako sa líši od black-box attack?

Black-box útočník nepozná vnútorné parametre a pracuje s dotazmi, výstupmi alebo náhradným modelom. White-box môže používať gradienty a presnú implementáciu cieľa.

Je FGSM white-box metóda?

V základnej forme áno, pretože používa znamienko gradientu straty podľa vstupu. Rovnaký nápad možno aproximovať aj cez surrogate model, ale potom sa mení znalostný scenár.

Prečo sa testuje aj nereálny plný prístup?

Poskytuje silný diagnostický horný scenár a odhaľuje gradient masking. Ak obrana zlyhá pri správne adaptovanom white-box útoku, nemožno ju považovať za robustnú.

Čo je adaptive attack?

Útočník upraví cieľ, optimalizáciu alebo diferenciáciu tak, aby výslovne zohľadnil konkrétnu obranu. Generický útok môže vyzerať neúspešne iba preto, že obranu nepozná.

Aké údaje má report obsahovať?

Threat model, povolené znalosti, normu perturbácie, epsilon, počet iterácií, restarty, success rate, čistú presnosť a overenie, že optimalizácia nebola umelo zablokovaná.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • NIST AI 100-2 E2025, Adversarial Machine Learning Explaining and Harnessing Adversarial Examples

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.