Odborná definice
Odborná definice
Adversarial attack je záměrná činnost útočníka, jejímž cílem je změnit chování modelu nebo AI systému manipulací dat, vstupů, modelových artefaktů, externích zdrojů či provozního prostředí. Útok může probíhat během sběru dat, tréninku, nasazení nebo inference. Mezi cíle patří snížení dostupnosti, obejití detekce, vynucení konkrétního výstupu, extrakce informací nebo narušení integrity systému. Posouzení proto vždy potřebuje explicitní threat model, který popisuje schopnosti, znalosti a omezení útočníka.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Běžná chyba vzniká náhodou, adversariální útok je navržen tak, aby model selhal ve prospěch útočníka. Někdo může přidat do tréninkových dat otrávené příklady, upravit obrázek tak, aby ho klasifikátor zaměnil, nebo vložit škodlivou instrukci do dokumentu, který čte agent. Obrana proto nezačíná pouze u modelu. Zahrnuje původ dat, přístupová práva, validaci vstupů, izolaci nástrojů, detekci anomálií a připravenou reakci na incident. Bez tohoto širšího pohledu může být model odolný vůči jednomu laboratornímu testu a přitom zranitelný prostřednictvím jednoduché integrace.
Časté otázky
Časté otázky
Jaké fáze životního cyklu může adversariální útok zasáhnout?
Útok může ovlivnit data před tréninkem, samotný trénink, distribuci modelu, API během inference i externí zdroje používané systémem. Otrava dat se snaží změnit naučené chování, evasion attack obchádza model při použití a útok na dodávatelský řetězec může nahradit model nebo knižnicu. Každá fáza vyžaduje odlišné kontrolní mechanizmy.
Co znamená white-box a black-box útok?
Při white-box útoku pozná útočník architekturu, parametry nebo gradienty modelu. Při black-box útoku vidí pouze vstupy a výstupy služby a model zkoumá přes dotazy. Mezi nimi existují grey-box scénáře s čiastočnými znalosťami. Obrana musí vycházet z realistického predpokladu o tom, co může útočník zjistit z dokumentace, API, úniků nebo veřejně dostupného modelu.
Je prompt injection adversariální útok?
Ano, v agentných a RAG systémech může jít o adversariálnu manipulaci instrukcí. Škodlivý text se snaží presvedčit model, aby ignoroval nadradené pravidla, odhalil data nebo použil nástroj neželaným způsobem. Ochrana zahrnuje oddělení důveryhodných a nedůveryhodných vstupů, minimálně oprávnění, potvrzení citlivých akcií a kontrolu výstupů.
Proč nestačí testovat pouze známymi útoky?
Útočník se přizpůsobuje obrane a může zvolit jinou optimalizaci, rozpočet dotazů nebo fyzické podmínky. Testování jedné metody dokazuje odolnost pouze vůči konkrétnímu scenáru. Potřebný je threat model, více rodín útoků, adaptivní red teaming a měření degradace při rastúcej sile útočníka. Výsledek se má interpretovat jako omezený důkaz, ne absolutní bezpečnost.
Jak se řídí adversariální riziko v organizaci?
Organizace vytvoří inventár modelů a datových toků, určí možné cíle útočníka, chrání tréninková artefakty a sleduje nezvyčajné dotazy či výstupy. Kritické systémy potřebují incident response, možnost rollbacku, rotaci klúčů a forenzné logy. Technické testy se spojují s kontrolou dodávatelů, zmluvnými požiadavkami a pravidelným prehodnotením hrozieb.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NIST AI 100-2e2025, Adversarial Machine Learning
- NIST AI Risk Management Framework
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
