Evaluace a lidské faktory

hodnocení vysvětlení AI

XAI evaluation je soubor experimentů, metrik a používatelských štúdií, kterými se posuzuje kvalita vysvětlení AI systému. Technická vrstva zkoumá například fidelity, stabilitu, citlivost, lokalizačnou přesnost nebo konzistenci. Funkční vrstva zjišťuje, či vysvětlení pomáhá odhalit chybu, porovnat modely nebo provést audit. Lidská vrstva měří porozumění, čas, správnost rozhodnutí a riziko nadmernej důvěry. Jediná univerzální metrika neexistuje, hodnotící protokol musí vycházet z konkrétního použití.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-X-02

Odborná definice

Odborná definice

XAI evaluation je soubor experimentů, metrik a používatelských štúdií, kterými se posuzuje kvalita vysvětlení AI systému. Technická vrstva zkoumá například fidelity, stabilitu, citlivost, lokalizačnou přesnost nebo konzistenci. Funkční vrstva zjišťuje, či vysvětlení pomáhá odhalit chybu, porovnat modely nebo provést audit. Lidská vrstva měří porozumění, čas, správnost rozhodnutí a riziko nadmernej důvěry. Jediná univerzální metrika neexistuje, hodnotící protokol musí vycházet z konkrétního použití.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pekná mapa, rebríček atributů ani plynulé slovné zdůvodnení ještě nedokazují, že vysvětlení funguje. Při hodnocení se nejprve určí úloha. Má uživatel najít chybný vstup, pochopit zamietnutie, nebo skontrolovat diskriminaci? Potom se měří, či vysvětlení opravdu sleduje model a či člověku pomohlo urobit lepší krok. Pokud zvýší pocit istoty, ale nezlepší správnost rozhodnutí, může být v praxi nebezpečnejšie než žiadne vysvětlení. Výsledek se proto zapisuje jako soubor metrik a pozorování, ne jako jediné skóre kvality.

Časté otázky

Časté otázky

Proč nestačí opýtat se uživatelů, zda se im vysvětlení páči?

Preference může zvýhodnit jednoduchý nebo sebavedomý príbeh, i když je technicky neverný. Uživatelské hodnocení je třeba kombinovat s meráním chování modelu a výsledků úlohy.

Co je application-grounded evaluation?

Jde o test s reálnymi uživateli, daty a rozhodovacou úlohou. Měří se přínos vysvětlení v skutečném pracovnom procese, ne pouze na abstraktnej metrice.

Kdy se používá proxy úloha?

Pokud je studie s odborníkmi příliš drahá nebo riziková, může se použít zjednodušený experiment. Proxy však musí zachovat rozhodující vlastnosti původního použití.

Má být hodnocení stejné pro všechny skupiny?

Ne. Odborník může potrebovat detailný diagnostický signál, dotknutá osoba stručný důvod a audítor reprodukovatelnou stopu. Výsledky se proto členia podle cílových uživatelů.

Jak se zabrání testování pouze úspešných příkladů?

Vzorek musí obsahovat správně i chybné predikce, hraniční případy, různé podskupiny a rušivé vstupy. Jinak protokol nadhodnotí spolehlivost vysvetlovacej metody.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NISTIR 8367, Psychological Foundations of Explainability Towards A Rigorous Science of Interpretable Machine Learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.