Odborná definice
Odborná definice
Interpretability je míra, do jaké člověk dokáže pochopit vnitřní mechanizmy modelu nebo vztah mezi vstupem a jeho výstupem v konkrétním kontextu. Může být inherentná, například při malém rozhodovacom strome, nebo post hoc, když se zložitému modelu vytvoří atribuce, příklady, pravidlová aproximace či kontrafaktuální vysvětlení. Pojem nemá jedinou univerzálnu metriku, proto se musí uvést uživatel, otázka a účel vysvětlení. Lokálně vysvětlení jednoho případu není globálnym popisem systému. Zrozumitelnost také nezaručuje věrnost, spravedlnost ani správnou predikci.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Úverový analytik může rozumět jednoduchému skórovaciemu modelu tak, že vidí koeficienty a směr jejich vlivu. Při hluboké síti dostane pro konkrétní žiadosť seznam znaků, které zvýšili nebo znížili skóre. Takový seznam může být zrozumitelný, ale pokud pouze přibližuje chování sítě, nemusí přesně opisovat její skutečný výpočet. Jiné vysvětlení potřebuje vývojář hladajúci chybu a jiné žiadatel, který chce vědět, co může opravit. Interpretovatelnost je proto vlastnost vztahu mezi modelem, metodou, člověkem a rozhodovacou otázkou.
Časté otázky
Časté otázky
Jaký je rozdíl mezi interpretability a explainability?
Termíny se používají nejednotne. Často interpretability označuje přímou pochopitelnost modelu a explainability šířeji metody vytvárajúce vysvětlení. Dokument má uvést vlastní pracovnou definici.
Co je lokálně vysvětlení?
Popisuje, proč model vytvořil konkrétní výstup pro jeden vstup nebo jeho okolí. Nemusí platit pro jinou osobu, čas ani vzdialenejšiu část vstupního prostoru.
Jak se měří věrnost vysvětlení?
Testuje se, či vysvetlujúca reprezentace reaguje spolu s původným modelem při perturbacích, či rekonštruuje jeho výstupy a či atribuce prejdou sanity checks. Lidská spokojnost sama nestačí.
Je jednodušší model vždy lépe interpretovatelný?
Ne automaticky. Velký strom nebo tisíce koeficientů mohou být prakticky neprehladné. Důležitá je složitost vzhledem na uživatele, úlohu a dostupný čas na rozhodnutí.
Kdy může vysvětlení zvýšit riziko?
Může vytvořit falešnou důveru, prezradit citlivé vlastnosti, ulahčit obchádzání modelu nebo zakrýt nejistotu. Proto se hodnotí správnost, publikum, bezpečnost a zamýšlané použití.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NISTIR 8312, Four Principles of Explainable Artificial Intelligence (doi.org) Doshi-Velez a Kim, Towards A Rigorous Science of Interpretable Machine Learning (arxiv.org)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
