Evaluácia a ľudské faktory

XAI evaluation

hodnotenie vysvetlení AI

XAI evaluation je súbor experimentov, metrík a používateľských štúdií, ktorými sa posudzuje kvalita vysvetlenia AI systému. Technická vrstva skúma napríklad fidelity, stabilitu, citlivosť, lokalizačnú presnosť alebo konzistenciu. Funkčná vrstva zisťuje, či vysvetlenie pomáha odhaliť chybu, porovnať modely alebo vykonať audit. Ľudská vrstva meria porozumenie, čas, správnosť rozhodnutia a riziko nadmernej dôvery. Jediná univerzálna metrika neexistuje, hodnotiaci protokol musí vychádzať z konkrétneho použitia.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-X-02

Odborná definícia

Odborná definícia

XAI evaluation je súbor experimentov, metrík a používateľských štúdií, ktorými sa posudzuje kvalita vysvetlenia AI systému. Technická vrstva skúma napríklad fidelity, stabilitu, citlivosť, lokalizačnú presnosť alebo konzistenciu. Funkčná vrstva zisťuje, či vysvetlenie pomáha odhaliť chybu, porovnať modely alebo vykonať audit. Ľudská vrstva meria porozumenie, čas, správnosť rozhodnutia a riziko nadmernej dôvery. Jediná univerzálna metrika neexistuje, hodnotiaci protokol musí vychádzať z konkrétneho použitia.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Pekná mapa, rebríček atribútov ani plynulé slovné zdôvodnenie ešte nedokazujú, že vysvetlenie funguje. Pri hodnotení sa najprv určí úloha. Má používateľ nájsť chybný vstup, pochopiť zamietnutie, alebo skontrolovať diskrimináciu? Potom sa meria, či vysvetlenie naozaj sleduje model a či človeku pomohlo urobiť lepší krok. Ak zvýši pocit istoty, ale nezlepší správnosť rozhodnutí, môže byť v praxi nebezpečnejšie než žiadne vysvetlenie. Výsledok sa preto zapisuje ako súbor metrík a pozorovaní, nie ako jediné skóre kvality.

Časté otázky

Časté otázky

Prečo nestačí opýtať sa používateľov, či sa im vysvetlenie páči?

Preferencia môže zvýhodniť jednoduchý alebo sebavedomý príbeh, aj keď je technicky neverný. Používateľské hodnotenie treba kombinovať s meraním správania modelu a výsledkov úlohy.

Čo je application-grounded evaluation?

Ide o test s reálnymi používateľmi, dátami a rozhodovacou úlohou. Meria sa prínos vysvetlenia v skutočnom pracovnom procese, nie iba na abstraktnej metrike.

Kedy sa používa proxy úloha?

Ak je štúdia s odborníkmi príliš drahá alebo riziková, môže sa použiť zjednodušený experiment. Proxy však musí zachovať rozhodujúce vlastnosti pôvodného použitia.

Má byť hodnotenie rovnaké pre všetky skupiny?

Nie. Odborník môže potrebovať detailný diagnostický signál, dotknutá osoba stručný dôvod a audítor reprodukovateľnú stopu. Výsledky sa preto členia podľa cieľových používateľov.

Ako sa zabráni testovaniu iba úspešných príkladov?

Vzorka musí obsahovať správne aj chybné predikcie, hraničné prípady, rôzne podskupiny a rušivé vstupy. Inak protokol nadhodnotí spoľahlivosť vysvetľovacej metódy.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • NISTIR 8367, Psychological Foundations of Explainability Towards A Rigorous Science of Interpretable Machine Learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.