Robustnost modelů

adversariální trénink

Adversarial training je tréninková metoda, při které se do učení záměrně zařazují adversariálně upravené vstupy a model se optimalizuje tak, aby na nich zachoval správné chování. Často se formuluje jako robustní optimalizace, která minimalizuje ztrátu při nejhorší povolené perturbaci v definovaném okolí vstupu. Metoda může zvýšit odolnost vůči konkrétní třídě útoků, ale výsledek závisí na threat modelu, síle generátoru útoků a tréninkového rozpočtu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-A-08

Odborná definice

Odborná definice

Adversarial training je tréninková metoda, při které se do učení záměrně zařazují adversariálně upravené vstupy a model se optimalizuje tak, aby na nich zachoval správné chování. Často se formuluje jako robustní optimalizace, která minimalizuje ztrátu při nejhorší povolené perturbaci v definovaném okolí vstupu. Metoda může zvýšit odolnost vůči konkrétní třídě útoků, ale výsledek závisí na threat modelu, síle generátoru útoků a tréninkového rozpočtu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Během běžného tréninku model vidí čisté příklady. Při adversariálním tréninku dostává i záměrně skomolené verze, které se snaží vyvolat chybu. Model se učí správně reagovat na obě. Je to podobné jako nácvik obrany proti simulovaným útokům, nikoli očkování proti všem budoucím hrozbám. Pokud se trénuje pouze proti malým změnám pixelů, nemusí to pomoci proti otravě dat, prompt injection ani útoku na externí nástroj. Účinnost se proto posuzuje proti nezávislému útočníkovi, který pozná obranu a cíleně se jí přizpůsobuje.

Časté otázky

Časté otázky

Jak se adversariální příklady vytvářejí během tréninku?

Nejčastěji se používají gradientové metody, které hladají perturbaci zvyšujúcu ztrátu modelu v povolenom rozsahu. Jednokrokový FGSM je rychlý, viacnásobný PGD bývá silnější a drahší. Při textových nebo štruktúrovaných datech se musí zásahy přizpůsobit platným změnám, aby příklad zostal zmysluplný a proveditelný.

Snižuje adversariální trénink accuracy na čistých datech?

Může. Robustnost vůči perturbáciám často vytváří kompromis s maximálnou přesností na nepoškodených vstupech, zejména při silnom threat modeli nebo omezené kapacite modelu. Rozsah kompromisu závisí na dat, architektury a optimalizace. Proto se zvlášť reportuje čistá accuracy, robustní accuracy a výpočetní náklady.

Chrání adversariální trénink před neznámymi útoky?

Poskytuje najsilnejší důkaz vůči útokům podobným tím, které byly zahrnuté do tréninku. Určitá odolnost se může přenést i na jiné metody, nelze ji však predpokladat. Adaptivní útočník může cielit na jinou normu perturbace, jinou fázu životního cyklu nebo samotnou obranu. Potřebné jsou nezávislé útoky a testování mimo tréninkové konfigurace.

Co znamená robustní accuracy?

Robustní accuracy je podíl případů, které model klasifikuje správně i po aplikování definovaného adversariálneho útoku. Hodnota má smysl pouze spolu s popisem útoku, rozpočtu, počtu kroků a znalostí útočníka. Slabý útok může vytvořit falešný dojem odolnosti. Při porovnání modelů musí být testovací protokol identický.

Kdy adversariální trénink není vhodnou první obranou?

Pokud hlavná hrozba vzniká v oprávneniach agenta, v nedůveryhodnom RAG obsahu, v úniku tajomstiev nebo v kompromitovanom dodávatelskom reťazci, trénink na perturbacích vstupu problém nevyrieši. Nejprve se má odstranit architektonická slabina, zaviesť minimálně oprávnění a validace. Adversariální trénink je jedna vrstva obrany, ne náhrada systémovej bezpečnosti.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST AI 100-2e2025, Adversarial Machine Learning
  • NIST AI Risk Management Framework

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.