Odborná definícia
Odborná definícia
Feature attribution je vysvetľovacia technika, ktorá priraďuje jednotlivým vstupným vlastnostiam číselný príspevok k určitej predikcii alebo výstupu modelu. Metódy sa líšia referenčným bodom, spôsobom perturbácie, využitím gradientov a predpokladmi o modeli. SHAP, Integrated Gradients, saliency mapy či occlusion preto nemusia vytvoriť rovnaké poradie. Atribúcia opisuje správanie modelu v zvolenom výpočtovom rámci, nie automaticky kauzálny vplyv feature na jav v reálnom svete.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Pri zamietnutej žiadosti môže atribučná metóda ukázať, že výsledné skóre najviac znížili vysoké zadlženie a krátka história účtu. Takéto čísla však závisia od porovnávacej základne a od toho, ako metóda narába so vzájomne previazanými premennými. Ak sú príjem a pracovná pozícia silno korelované, príspevok sa medzi ne môže rozdeliť rôzne. Vysvetlenie preto treba overiť stabilitou, doménovým zmyslom a testom, či sa predikcia pri riadenej zmene vstupu naozaj mení.
Časté otázky
Časté otázky
Je feature attribution kauzálne vysvetlenie?
Spravidla nie. Ukazuje, ako model matematicky reaguje na vstup alebo referenciu. Bez kauzálneho návrhu nemožno tvrdiť, že zmena feature spôsobí zmenu reality.
Čo je baseline pri Integrated Gradients?
Je to referenčný vstup, od ktorého sa integrujú gradienty smerom k analyzovanému príkladu. Nevhodná baseline môže zásadne zmeniť rozdelenie atribúcií.
Prečo sa atribúcie menia medzi metódami?
Každá metóda definuje príspevok inak. Odlišne pracuje s nelinearitou, koreláciou, lokálnym okolím a tým, čo považuje za chýbajúcu feature.
Ako sa testuje vernosť vysvetlenia?
Možno odstrániť alebo meniť vysoko hodnotené vstupy a sledovať pokles predikcie, porovnať výsledky pri viacerých baseline a vykonať sanity checks modelu.
Môže atribúcia odhaliť chybný model?
Áno, napríklad keď obrazový klasifikátor využíva pozadie namiesto objektu. Samotná pekná heatmapa však nie je dôkazom správnosti ani úplnosti vysvetlenia.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Sundararajan et al., Axiomatic Attribution for Deep Networks
- Lundberg and Lee, A Unified Approach to Interpreting Model Predictions
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
