Validace a testování

Evaluační dataset

Evaluation dataset je soubor příkladů a očakávaných výsledků nebo hodnotiacich kritérií, který se používá na měření chování modelu či celého AI systému. Může být validační, testovací, regresný, bezpečnostní, kontrafaktuálny nebo scenárový. Musí mít zdokumentovaný původ, cílovou populaci, anotátorů, časový rozsah, pravidla použití a známé medzery. Pokud se podle výsledků opakovaně ladí systém, dataset prestáva být nezávislým testem a je třeba zaviesť nový holdout nebo slepou evaluaci.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-E-20

Odborná definice

Odborná definice

Evaluation dataset je soubor příkladů a očakávaných výsledků nebo hodnotiacich kritérií, který se používá na měření chování modelu či celého AI systému. Může být validační, testovací, regresný, bezpečnostní, kontrafaktuálny nebo scenárový. Musí mít zdokumentovaný původ, cílovou populaci, anotátorů, časový rozsah, pravidla použití a známé medzery. Pokud se podle výsledků opakovaně ladí systém, dataset prestáva být nezávislým testem a je třeba zaviesť nový holdout nebo slepou evaluaci.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Evaluační dataset je skúšobná sada, kterou model nemá používat jako učebnicu. Při chatbotovi může obsahovat reálně otázky, správně podklady, zakázané typy odpovědí a kritéria pro citace. Samotný počet příkladů nestačí. Pokud sada obsahuje pouze jednoduché otázky od expertů, nebude reprezentovat nejasné formulace běžných uživatelů. Každá oprava systému může zároveň vést k nevedomému prispůsobení testu, proto se oddeluje pracovná regresná sada od chráneného finálneho hodnocení.

Časté otázky

Časté otázky

Jaký je rozdíl mezi validačným a testovacím datasetem?

Validace podporuje výběr modelu, promptu nebo hyperparametrů. Test se má použít až na nezávislé posouzení zvolené verze a nemá riadit další ladění.

Musí mít každý příklad jednu správnou odpověď?

Ne. Při otevřeném generování může obsahovat rubriku, povinné fakta, zakázané tvrzení, zdrojové důkazy a více prijatelných odpovědí.

Jak se buduje reprezentativní eval sada?

Vychází z cílových uživatelů, provozních logů, rizikových scenárů a očakávaných změn. Zastoupení se kontroluje po jazyku, skupině a náročnosti.

Co je regresný eval dataset?

Stála sada kritických případů spúšťaná po každé změně. Má zachytit, či oprava jedné funkce nepoškodila už fungujúce chování.

Jak se chrání před únikom do tréninku?

Oddelí se přístup, eviduje původ dat, používá se novší časový řez, hashování, canary obsah a zmluvné pravidla pro externích dodávatelů.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.