Bezpečnost AI

Datové otrávení

Datové otrávení je útok nebo škodlivé zasahování do tréninkových dat, při kterém útočník vkladá, mění nebo selektívne odstraňuje příklady tak, aby ovplyvnil naučené chování modelu. Cílem může být obecné zhoršení výkonu, posun rozhodovací hranice, diskrétna manipulace konkrétní třídy nebo vytvoření zadných vrátok aktivovaných špecifickým vzorom. Útok může zasáhnout surová data, štítky, zpětnou vezbu uživatelů i externí zdroje automaticky sťahované do tréninkové pipeline.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-06

Odborná definice

Odborná definice

Datové otrávení je útok nebo škodlivé zasahování do tréninkových dat, při kterém útočník vkladá, mění nebo selektívne odstraňuje příklady tak, aby ovplyvnil naučené chování modelu. Cílem může být obecné zhoršení výkonu, posun rozhodovací hranice, diskrétna manipulace konkrétní třídy nebo vytvoření zadných vrátok aktivovaných špecifickým vzorom. Útok může zasáhnout surová data, štítky, zpětnou vezbu uživatelů i externí zdroje automaticky sťahované do tréninkové pipeline.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si systém, který se průběžně učí z nahlásených podvodů. Útočník může opakovaně označovat vlastní podvodné transakce jako bezpečné nebo zaplavovat systém příklady, které vytvoří zavádzajúce pravidlo. Model potom nezačne zlyhávat náhodně, ale přesně tam, kde to útočník potřebuje. Datové otrávení je nebezpečné zejména v otvorených zberných kanáloch, při crowdsourcingu a při automatickom preberaní webového obsahu bez ověření původu a anomálií.

Časté otázky

Časté otázky

Jak se otrávení liší od adversariálneho příkladu?

Otrávení zasahuje trénink a mění budúci model. Adversariální příklad manipuluje vstup během inference bez nutnej změny tréninkových dat.

Co je backdoor poisoning?

Útočník vloží vzor spojený s vybraným výstupem. Model se navonok správa normálně, ale při výskyte spúšťača provede útočníkem požadovanou predikci.

Které zdroje dat jsou najrizikovejšie?

Otevřené formuláre, používatelská zpětná vazba, verejné webové zdroje, partnerské datasety bez provenance a automatické self training smyčky.

Jak se útok zmierňuje?

Používá se kontrola původu, přístupové řízení, detekce anomálií, robustní trénink, vzorková manuálna revize a oddělení důveryhodného referenčního datasetu.

Lze otrávení zcela vylúčit?

Ne při každém otevřeném systéme. Cílem je snížit pravděpodobnost, omezit dosah, rychle odhalit odchylku a vědět obnovit čistou verzi dat i modelu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.