Odborná definice
Odborná definice
Benchmark dataset je štandardizovaný soubor dat a hodnotící protokol používaný na porovnávání modelů při stejné nebo přesně definovanej úloze. Zahrnuje vstupy, referenční výstupy nebo anotace, pravidla dělení, metriky a často i omezení použití. Dobrý benchmark měří relevantní schopnost, obsahuje reprezentativní a kvalitné příklady a chrání testovaci část před kontaminací. Vysoké skóre nepreukazuje obecnou kvalitu modelu, pokud je dataset úzký, saturovaný, uniknutý do tréninku nebo vzdálený od produkčného kontextu.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Benchmark je společná skúšobná trať, na které se modely hodnotí podle stejných pravidel. Díky ní lze porovnat architektury bez toho, aby každý tím zvolil vlastní snazší data. Problém nastane, když se tímy roky prispůsobují jedné skúške nebo se její otázky dostanou do tréninkových korpusů. Model potom může poznat vzory benchmarku, ale selhat na nových případech. Při nasazení proto je třeba doplnit verejné skóre interným testem, který odráží jazyk, uživatelů, rizika a provozní podmínky konkrétního systému.
Časté otázky
Časté otázky
Co patří k benchmarku kromě datasetu?
Přesná definice úlohy, train, validation a test split, metriky, předzpracování, pravidla použití externích dat a postup reportování. Bez protokolu mohou dvě stejné čísla vzniknout neporovnatelným způsobem.
Co je benchmark contamination?
Testovací položky nebo jejich blízké varianty se objeví v tréninkových datech, příkladech promptu nebo procese ladění. Skóre potom částečně měří zapametání. Při webových korpusoch je odhalení kontaminace náročné, proto se používají nové a neverejné testy.
Proč benchmark nemusí predpovedat produkční výkon?
Produkce může mít jiný jazyk, distribuci, délku vstupů, časový horizont, cenu chyb a interakci uživatelů. Benchmark obvykle izoluje jednu schopnost. Externá validita se musí ověřit na datech a scenároch z cílového prostředí.
Co znamená saturace benchmarku?
Mnoho modelů dosahuje velmi podobné vysoké skóre a rozdíly jsou menší než nejistota měření nebo praktický význam. Benchmark prestáva rozlišovat pokrok. Potřebné jsou náročnější, pestrejšie nebo dynamicky obnovované úlohy.
Jak se má benchmark dokumentovat pro E-E-A-T?
Uveďte původ dat, licenci, anotátorů, časové období, demografické a jazykové pokrytí, známé limity, metriku, verzi a datum evaluace. Při citlivých datech je třeba popísat i právní základ a ochranu soukromí.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Google Machine Learning Glossary, benchmark and datasets
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
