Odborná definícia
Odborná definícia
Interpretability je miera, do akej človek dokáže pochopiť vnútorné mechanizmy modelu alebo vzťah medzi vstupom a jeho výstupom v konkrétnom kontexte. Môže byť inherentná, napríklad pri malom rozhodovacom strome, alebo post hoc, keď sa zložitému modelu vytvoria atribúcie, príklady, pravidlová aproximácia či kontrafaktuálne vysvetlenie. Pojem nemá jedinú univerzálnu metriku, preto sa musí uviesť používateľ, otázka a účel vysvetlenia. Lokálne vysvetlenie jedného prípadu nie je globálnym opisom systému. Zrozumiteľnosť tiež nezaručuje vernosť, spravodlivosť ani správnu predikciu.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Úverový analytik môže rozumieť jednoduchému skórovaciemu modelu tak, že vidí koeficienty a smer ich vplyvu. Pri hlbokej sieti dostane pre konkrétnu žiadosť zoznam znakov, ktoré zvýšili alebo znížili skóre. Taký zoznam môže byť zrozumiteľný, no ak iba približuje správanie siete, nemusí presne opisovať jej skutočný výpočet. Iné vysvetlenie potrebuje vývojár hľadajúci chybu a iné žiadateľ, ktorý chce vedieť, čo môže opraviť. Interpretovateľnosť je preto vlastnosť vzťahu medzi modelom, metódou, človekom a rozhodovacou otázkou.
Časté otázky
Časté otázky
Aký je rozdiel medzi interpretability a explainability?
Termíny sa používajú nejednotne. Často interpretability označuje priamu pochopiteľnosť modelu a explainability širšie metódy vytvárajúce vysvetlenia. Dokument má uviesť vlastnú pracovnú definíciu.
Čo je lokálne vysvetlenie?
Opisuje, prečo model vytvoril konkrétny výstup pre jeden vstup alebo jeho okolie. Nemusí platiť pre inú osobu, čas ani vzdialenejšiu časť vstupného priestoru.
Ako sa meria vernosť vysvetlenia?
Testuje sa, či vysvetľujúca reprezentácia reaguje spolu s pôvodným modelom pri perturbáciách, či rekonštruuje jeho výstupy a či atribúcie prejdú sanity checks. Ľudská spokojnosť sama nestačí.
Je jednoduchší model vždy lepšie interpretovateľný?
Nie automaticky. Veľký strom alebo tisíce koeficientov môžu byť prakticky neprehľadné. Dôležitá je zložitosť vzhľadom na používateľa, úlohu a dostupný čas na rozhodnutie.
Kedy môže vysvetlenie zvýšiť riziko?
Môže vytvoriť falošnú dôveru, prezradiť citlivé vlastnosti, uľahčiť obchádzanie modelu alebo zakryť neistotu. Preto sa hodnotí správnosť, publikum, bezpečnosť a zamýšľané použitie.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- NISTIR 8312, Four Principles of Explainable Artificial Intelligence (doi.org) Doshi-Velez a Kim, Towards A Rigorous Science of Interpretable Machine Learning (arxiv.org)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
