Odborná definice
Odborná definice
Feature attribution je vysvetlovace technika, která přiřazuje jednotlivým vstupním vlastnostem číselný příspěvek k určité predikci nebo výstupu modelu. Metody se liší referenčním bodem, způsobem perturbace, využitím gradientů a predpokladmi o modeli. SHAP, Integrated Gradients, saliency mapy či occlusion proto nemusí vytvořit stejné pořadí. Atribuce popisuje chování modelu v zvoleném výpočtovém rámci, ne automaticky kauzální vliv feature na jev v reálném svete.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Při zamietnutej žiadosti může atribučná metoda ukázat, že výsledné skóre nejvíce znížili vysoké zadlžení a krátka historie účtu. Takéto čísla však závisí na porovnávacej základne a od toho, jako metoda narába se vzájomne previazanými premennými. Pokud jsou příjem a pracovná pozíce silně korelované, příspěvek se mezi ne může rozdelit různé. Vysvětlení proto je třeba ověřit stabilitou, doménovým zmyslom a testem, zda se predikce při riadenej změně vstupu opravdu mění.
Časté otázky
Časté otázky
Je feature attribution kauzální vysvětlení?
Zpravidla ne. Ukazuje, jako model matematicky reaguje na vstup nebo referenci. Bez kauzálneho návrhu nelze tvrdit, že změna feature spůsobí změnu reality.
Co je baseline při Integrated Gradients?
Je to referenční vstup, od kterého se integrují gradienty směrem k analyzovanému příkladu. Nevhodná baseline může zásadne změnit rozdělení atribucí.
Proč se atribuce mění mezi metódami?
Každá metoda definuje příspěvek jinak. Odlišne pracuje s nelinearitou, korelací, lokálnym okolím a tím, co považuje za chýbajúcu feature.
Jak se testuje věrnost vysvětlení?
Lze odstranit nebo měnit vysoce hodnocené vstupy a sledovat pokles predikce, porovnat výsledky při více baseline a provést sanity checks modelu.
Může atribuce odhalit chybný model?
Ano, například když obrazový klasifikátor využívá pozadí místo objektu. Samotná pekná heatmapa však není důkazem správnosti ani úplnosti vysvětlení.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Sundararajan et al., Axiomatic Attribution for Deep Networks
- Lundberg and Lee, A Unified Approach to Interpreting Model Predictions
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
