Odborná definice
Odborná definice
Offline evaluation je hodnocení modelu na předem zozbieraných datech nebo simulovaných případech bez toho, aby nový model přímo ovplyvňoval živých uživatelů či prostředí. Zahrnuje oddělení tréninkové, validační a testovací množiny, reprodukovatelnou metriku, segmentové analýzy a porovnání s referenčním řešením. Při odporúčaniach nebo rozhodovacích politikách může používat historické logy a counterfactual odhady. Její platnost závisí na reprezentativnosti dat a od shody mezi testovacím protokolom a skutočným produkčným cílem.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Před nasazením nového vyhladávača lze prehrat archív otázek a zjistit, či vrací relevantnejšie dokumenty než stará verze. Takový test je bezpečný a opakovatelný, ale neukáže vše. Uživatelé mohou na nové výsledky reagovat jinak, historické logy vznikli pod starým rozhráním a manuálne reference mohou být neúplné. Offline výsledek proto slouží jako vstupní brána, ne jako důkaz produkčného přínosu. Po ňom nasleduje omezený online experiment, sledování vedlajších účinků a plán návratu na predchádzajúcu verzi.
Časté otázky
Časté otázky
Proč dobrá offline metrika nemusí zlepšit produkt?
Metrika může zachytávat pouze technickou podobnost, zatímco uživateli záleží na čase, důvere nebo úspešnom dokončení úlohy. Historické data navíc neobsahují reakce na nový systém.
Jako zabránit úniku informací do testu?
Testovací množina se uzamkne před ladením, deduplikují se příbuzné záznamy a rozdělení respektuje čas, uživatele nebo zdroj. Každé rozhodnutí podle testu snižuje jeho nezávislost.
Co je slice-based evaluation?
Výkon se počítá zvlášť pro významné segmenty, například jazyk, typ dokumentu, zařízení nebo rizikovou skupinu. Odhalí lokálně selhání, které globální průměr skryje.
Kdy je třeba používat lidských hodnotitelů?
Když automatická metrika neví spolehlivě posoudit faktičnost, užitečnost, bezpečnost nebo kvalitu otevřeného textu. Potřebná je jasná rubrika, školení a měření shody mezi hodnotitelmi.
Je replay historických logů vždy nestranný?
Ne. Logy zachycují pouze akce, které umožnila stará politika, a chýbají výsledky nevyskúšaných alternatív. Při counterfactual evaluaci se proto modeluje propensita a sleduje podpora dat.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NIST AI RMF, Measure Function
- Google, Rules of Machine Learning
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
