Odborná definícia
Odborná definícia
Offline evaluation je hodnotenie modelu na vopred zozbieraných dátach alebo simulovaných prípadoch bez toho, aby nový model priamo ovplyvňoval živých používateľov či prostredie. Zahŕňa oddelenie tréningovej, validačnej a testovacej množiny, reprodukovateľnú metriku, segmentové analýzy a porovnanie s referenčným riešením. Pri odporúčaniach alebo rozhodovacích politikách môže používať historické logy a counterfactual odhady. Jej platnosť závisí od reprezentatívnosti dát a od zhody medzi testovacím protokolom a skutočným produkčným cieľom.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Pred nasadením nového vyhľadávača možno prehrať archív otázok a zistiť, či vracia relevantnejšie dokumenty než stará verzia. Taký test je bezpečný a opakovateľný, no neukáže všetko. Používatelia môžu na nové výsledky reagovať inak, historické logy vznikli pod starým rozhraním a manuálne referencie môžu byť neúplné. Offline výsledok preto slúži ako vstupná brána, nie ako dôkaz produkčného prínosu. Po ňom nasleduje obmedzený online experiment, sledovanie vedľajších účinkov a plán návratu na predchádzajúcu verziu.
Časté otázky
Časté otázky
Prečo dobrá offline metrika nemusí zlepšiť produkt?
Metrika môže zachytávať iba technickú podobnosť, zatiaľ čo používateľovi záleží na čase, dôvere alebo úspešnom dokončení úlohy. Historické dáta navyše neobsahujú reakcie na nový systém.
Ako zabrániť úniku informácií do testu?
Testovacia množina sa uzamkne pred ladením, deduplikujú sa príbuzné záznamy a rozdelenie rešpektuje čas, používateľa alebo zdroj. Každé rozhodnutie podľa testu znižuje jeho nezávislosť.
Čo je slice-based evaluation?
Výkon sa počíta osobitne pre významné segmenty, napríklad jazyk, typ dokumentu, zariadenie alebo rizikovú skupinu. Odhalí lokálne zlyhanie, ktoré globálny priemer skryje.
Kedy treba používať ľudských hodnotiteľov?
Keď automatická metrika nevie spoľahlivo posúdiť faktickosť, užitočnosť, bezpečnosť alebo kvalitu otvoreného textu. Potrebná je jasná rubrika, školenie a meranie zhody medzi hodnotiteľmi.
Je replay historických logov vždy nestranný?
Nie. Logy zachytávajú iba akcie, ktoré umožnila stará politika, a chýbajú výsledky nevyskúšaných alternatív. Pri counterfactual evaluácii sa preto modeluje propensita a sleduje podpora dát.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- NIST AI RMF, Measure Function
- Google, Rules of Machine Learning
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
