Testovanie a validácia AI

Model evaluation

Hodnotenie modelu

Model evaluation je systematické meranie schopností, chýb a obmedzení modelu na dátach a scenároch oddelených od prispôsobovania parametrov. Zahŕňa výber metrík, testovaciu schému, segmentáciu výsledkov, odhad neistoty, porovnanie s baseline a analýzu zlyhaní. Evaluácia musí zodpovedať zamýšľanému použitiu, distribúcii prevádzkových vstupov a nákladom rozhodnutí. Jedna priemerná metrika nestačí na posúdenie robustnosti, kalibrácie, fairness, bezpečnosti ani výkonu pri okrajových prípadoch.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-M-21

Odborná definícia

Odborná definícia

Model evaluation je systematické meranie schopností, chýb a obmedzení modelu na dátach a scenároch oddelených od prispôsobovania parametrov. Zahŕňa výber metrík, testovaciu schému, segmentáciu výsledkov, odhad neistoty, porovnanie s baseline a analýzu zlyhaní. Evaluácia musí zodpovedať zamýšľanému použitiu, distribúcii prevádzkových vstupov a nákladom rozhodnutí. Jedna priemerná metrika nestačí na posúdenie robustnosti, kalibrácie, fairness, bezpečnosti ani výkonu pri okrajových prípadoch.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Hodnotenie modelu nie je iba spustenie accuracy na náhodne odloženej pätine dát. Najprv treba určiť, aké rozhodnutie bude model podporovať, ktoré chyby sú kritické a aké situácie nastanú v prevádzke. Test môže byť časovo oddelený, rozdelený podľa zariadenia, regiónu, jazyka alebo typu používateľa. Dôležité je porovnať model s jednoduchou baseline a preskúmať konkrétne zlyhania. Ak sa testovacia sada opakovane používa pri ladení, prestáva byť nezávislým dôkazom generalizácie.

Časté otázky

Časté otázky

Aký je rozdiel medzi validačnou a testovacou sadou?

Validačná sada slúži na výber modelu, prahov a hyperparametrov. Testovacia sada sa má použiť až na nezávislé finálne posúdenie zvolenej konfigurácie.

Prečo nestačí jedna metrika?

Rôzne metriky zachytávajú iné typy chýb. Rovnaké F1 môže skrývať rozdielnu kalibráciu, latenciu, výkon menšinových skupín alebo bezpečnostné zlyhania.

Čo je baseline?

Jednoduchý referenčný postup, napríklad väčšinová trieda, pravidlo alebo existujúci proces. Model musí preukázať prínos oproti reálnej alternatíve.

Ako sa hodnotí generatívny model?

Kombináciou automatických metrík, task-based testov, ľudského hodnotenia, kontroly faktickosti, bezpečnostných scenárov a konzistencie pri opakovaní.

Čo je data leakage v evaluácii?

Informácia z testu ovplyvní tréning, výber príznakov, normalizáciu alebo ladenie. Výsledok potom nadhodnocuje výkon na skutočne nových dátach.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • scikit-learn, model evaluation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.