Validace a experimentování

Offline evaluation

Offline evaluation je hodnocení modelu na předem zozbieraných datech nebo simulovaných případech bez toho, aby nový model přímo ovplyvňoval živých uživatelů či prostředí. Zahrnuje oddělení tréninkové, validační a testovací množiny, reprodukovatelnou metriku, segmentové analýzy a porovnání s referenčním řešením. Při odporúčaniach nebo rozhodovacích politikách může používat historické logy a counterfactual odhady. Její platnost závisí na reprezentativnosti dat a od shody mezi testovacím protokolom a skutočným produkčným cílem.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-O-07

Odborná definice

Odborná definice

Offline evaluation je hodnocení modelu na předem zozbieraných datech nebo simulovaných případech bez toho, aby nový model přímo ovplyvňoval živých uživatelů či prostředí. Zahrnuje oddělení tréninkové, validační a testovací množiny, reprodukovatelnou metriku, segmentové analýzy a porovnání s referenčním řešením. Při odporúčaniach nebo rozhodovacích politikách může používat historické logy a counterfactual odhady. Její platnost závisí na reprezentativnosti dat a od shody mezi testovacím protokolom a skutočným produkčným cílem.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Před nasazením nového vyhladávača lze prehrat archív otázek a zjistit, či vrací relevantnejšie dokumenty než stará verze. Takový test je bezpečný a opakovatelný, ale neukáže vše. Uživatelé mohou na nové výsledky reagovat jinak, historické logy vznikli pod starým rozhráním a manuálne reference mohou být neúplné. Offline výsledek proto slouží jako vstupní brána, ne jako důkaz produkčného přínosu. Po ňom nasleduje omezený online experiment, sledování vedlajších účinků a plán návratu na predchádzajúcu verzi.

Časté otázky

Časté otázky

Proč dobrá offline metrika nemusí zlepšit produkt?

Metrika může zachytávat pouze technickou podobnost, zatímco uživateli záleží na čase, důvere nebo úspešnom dokončení úlohy. Historické data navíc neobsahují reakce na nový systém.

Jako zabránit úniku informací do testu?

Testovací množina se uzamkne před ladením, deduplikují se příbuzné záznamy a rozdělení respektuje čas, uživatele nebo zdroj. Každé rozhodnutí podle testu snižuje jeho nezávislost.

Co je slice-based evaluation?

Výkon se počítá zvlášť pro významné segmenty, například jazyk, typ dokumentu, zařízení nebo rizikovou skupinu. Odhalí lokálně selhání, které globální průměr skryje.

Kdy je třeba používat lidských hodnotitelů?

Když automatická metrika neví spolehlivě posoudit faktičnost, užitečnost, bezpečnost nebo kvalitu otevřeného textu. Potřebná je jasná rubrika, školení a měření shody mezi hodnotitelmi.

Je replay historických logů vždy nestranný?

Ne. Logy zachycují pouze akce, které umožnila stará politika, a chýbají výsledky nevyskúšaných alternatív. Při counterfactual evaluaci se proto modeluje propensita a sleduje podpora dat.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST AI RMF, Measure Function
  • Google, Rules of Machine Learning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.