Adversariální strojové učení a bezpečnost

útok s úplnou znalostí cílového modelu

White-box attack je adversariální útok, při kterém útočník pozná nebo může přímo používat vnitřní informace cílového systému, například architekturu, parametry, gradienty, tréninkový postup nebo obranné mechanizmy. Tato znalost umožňuje optimalizovat vstup, poisoning strategii nebo extrakčný cíl přímo vůči modelu. V evasion scenári se často počítá gradient ztráty podle vstupu a hledá se perturbace v povolenom prostoru. White-box označuje úroveň znalosti a přístupu, ne konkrétní algoritmus ani automaticky najsilnejší realistický útok. Hodnocení musí uvést normu, rozpočet, počet kroků a adaptaci na obranu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-20

Odborná definice

Odborná definice

White-box attack je adversariální útok, při kterém útočník pozná nebo může přímo používat vnitřní informace cílového systému, například architekturu, parametry, gradienty, tréninkový postup nebo obranné mechanizmy. Tato znalost umožňuje optimalizovat vstup, poisoning strategii nebo extrakčný cíl přímo vůči modelu. V evasion scenári se často počítá gradient ztráty podle vstupu a hledá se perturbace v povolenom prostoru. White-box označuje úroveň znalosti a přístupu, ne konkrétní algoritmus ani automaticky najsilnejší realistický útok. Hodnocení musí uvést normu, rozpočet, počet kroků a adaptaci na obranu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Je to situace, ve které útočník neháda chování modelu pouze z odpovědí. Má jeho výkres, parametry a ví si vypočítat, kterým směrem je třeba změnit vstup, aby se zvýšila chyba. Při obrázku může gradient ukázat kombinaci drobných změn pixelů, při jazykovém systéme může interný přístup pomoci hladat citlivé reprezentace nebo obchádzat filtr. Takový test představuje prísny bezpečnostní scenár, ale musí respektovat reálně omezení. Útok bez rozpočtu nebo s informacemi, které nasazený protivník nemůže získat, měří jinou hrozbu.

Časté otázky

Časté otázky

Jak se liší od black-box attack?

Black-box útočník nepozná vnitřní parametry a pracuje s dotazmi, výstupy nebo náhradným modelem. White-box může používat gradienty a přesnou implementaci cíle.

Je FGSM white-box metoda?

V základní forme ano, protože používá znaménko gradientu ztráty podle vstupu. Stejný nápad lze aproximovat i přes surrogate model, ale potom se mění znalostní scenár.

Proč se testuje i nereálný plný přístup?

Poskytuje silný diagnostický horný scenár a odhaluje gradient masking. Pokud obrana selže při správně adaptovanom white-box útoku, nelze ji považovat za robustnou.

Co je adaptive attack?

Útočník upraví cíl, optimalizaci nebo diferenciaci tak, aby výslovne zohladnil konkrétní obranu. Generický útok může vyzerat neúspešne pouze proto, že obranu nepozná.

Jaké údaje má report obsahovat?

Threat model, povolené znalosti, normu perturbace, epsilon, počet iterací, restarty, success rate, čistou přesnost a ověření, že optimalizace nebola uměle zablokovaná.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST AI 100-2 E2025, Adversarial Machine Learning Explaining and Harnessing Adversarial Examples

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.