Robustnosť modelov

Adversarial training

Adversarial training je tréningová metóda, pri ktorej sa do učenia zámerne zaraďujú adversariálne upravené vstupy a model sa optimalizuje tak, aby na nich zachoval správne správanie. Často sa formuluje ako robustná optimalizácia, ktorá minimalizuje stratu pri najhoršej povolenej perturbácii v definovanom okolí vstupu. Metóda môže zvýšiť odolnosť voči konkrétnej triede útokov, no výsledok závisí od threat modelu, sily generátora útokov a tréningového rozpočtu.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-A-08

Odborná definícia

Odborná definícia

Adversarial training je tréningová metóda, pri ktorej sa do učenia zámerne zaraďujú adversariálne upravené vstupy a model sa optimalizuje tak, aby na nich zachoval správne správanie. Často sa formuluje ako robustná optimalizácia, ktorá minimalizuje stratu pri najhoršej povolenej perturbácii v definovanom okolí vstupu. Metóda môže zvýšiť odolnosť voči konkrétnej triede útokov, no výsledok závisí od threat modelu, sily generátora útokov a tréningového rozpočtu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Počas bežného tréningu model vidí čisté príklady. Pri adversariálnom tréningu dostáva aj zámerne skomolené verzie, ktoré sa snažia vyvolať chybu. Model sa učí správne reagovať na obe. Je to podobné ako nácvik obrany proti simulovaným útokom, nie očkovanie proti všetkým budúcim hrozbám. Ak sa trénuje iba proti malým zmenám pixelov, nemusí to pomôcť proti otrave dát, prompt injection ani útoku na externý nástroj. Účinnosť sa preto posudzuje proti nezávislému útočníkovi, ktorý pozná obranu a cielene sa jej prispôsobuje.

Časté otázky

Časté otázky

Ako sa adversariálne príklady vytvárajú počas tréningu?

Najčastejšie sa používajú gradientové metódy, ktoré hľadajú perturbáciu zvyšujúcu stratu modelu v povolenom rozsahu. Jednokrokový FGSM je rýchly, viacnásobný PGD býva silnejší a drahší. Pri textových alebo štruktúrovaných dátach sa musia zásahy prispôsobiť platným zmenám, aby príklad zostal zmysluplný a uskutočniteľný.

Znižuje adversariálny tréning accuracy na čistých dátach?

Môže. Robustnosť voči perturbáciám často vytvára kompromis s maximálnou presnosťou na nepoškodených vstupoch, najmä pri silnom threat modeli alebo obmedzenej kapacite modelu. Rozsah kompromisu závisí od dát, architektúry a optimalizácie. Preto sa osobitne reportuje čistá accuracy, robustná accuracy a výpočtové náklady.

Chráni adversariálny tréning pred neznámymi útokmi?

Poskytuje najsilnejší dôkaz voči útokom podobným tým, ktoré boli zahrnuté do tréningu. Určitá odolnosť sa môže preniesť aj na iné metódy, nemožno ju však predpokladať. Adaptívny útočník môže cieliť na inú normu perturbácie, inú fázu životného cyklu alebo samotnú obranu. Potrebné sú nezávislé útoky a testovanie mimo tréningovej konfigurácie.

Čo znamená robustná accuracy?

Robustná accuracy je podiel prípadov, ktoré model klasifikuje správne aj po aplikovaní definovaného adversariálneho útoku. Hodnota má zmysel iba spolu s opisom útoku, rozpočtu, počtu krokov a znalostí útočníka. Slabý útok môže vytvoriť falošný dojem odolnosti. Pri porovnaní modelov musí byť testovací protokol identický.

Kedy adversariálny tréning nie je vhodnou prvou obranou?

Ak hlavná hrozba vzniká v oprávneniach agenta, v nedôveryhodnom RAG obsahu, v úniku tajomstiev alebo v kompromitovanom dodávateľskom reťazci, tréning na perturbáciách vstupu problém nevyrieši. Najprv sa má odstrániť architektonická slabina, zaviesť minimálne oprávnenia a validácia. Adversariálny tréning je jedna vrstva obrany, nie náhrada systémovej bezpečnosti.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • NIST AI 100-2e2025, Adversarial Machine Learning
  • NIST AI Risk Management Framework

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.