Jazykové data a znalostní zdroje

Textový nebo multimodální korpus

Corpus je systematicky zhromaždená kolekce jazykových nebo multimodálnych dat určená na výzkum, trénink, evaluaci nebo vyhledávání. Může obsahovat dokumenty, prepisy řeči, dialógy, anotace, obrázky s popismi a metadata o původe, jazyku, čase a licencii. Korpus není pouze priečinok souborů, jeho použitelnost závisí na kritérií výběru, reprezentativnosti, deduplikace, kvality anotací a dokumentace. Stejný obsah může být vhodný pro fulltext, ale nevhodný na trénink modelu pro právně, súkromné nebo metodické omezení.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-22

Odborná definice

Odborná definice

Corpus je systematicky zhromaždená kolekce jazykových nebo multimodálnych dat určená na výzkum, trénink, evaluaci nebo vyhledávání. Může obsahovat dokumenty, prepisy řeči, dialógy, anotace, obrázky s popismi a metadata o původe, jazyku, čase a licencii. Korpus není pouze priečinok souborů, jeho použitelnost závisí na kritérií výběru, reprezentativnosti, deduplikace, kvality anotací a dokumentace. Stejný obsah může být vhodný pro fulltext, ale nevhodný na trénink modelu pro právně, súkromné nebo metodické omezení.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud chcete vytvořit model pro slovenskou zákaznícku podporu, nestačí stiahnuť náhodné webové stránky. Potrebujete vědět, jaké typy otázek, dialektů, produktů a období kolekce pokrývá, kdo text vytvořil a či ho smiete použít. Korpus může obsahovat surová rozhovory, očistenou verzi i manuálne označené intenty. Každá úprava mění jeho význam. Dobře spravovaný korpus má datový list, verzi, rozdělení na trénink a test a proces odstranění záznamu, když se změní souhlas nebo licence.

Časté otázky

Časté otázky

Jak se korpus liší od datasetu?

Dataset je širší pojem pro štruktúrovanou kolekci dat lubovolného typu. Corpus se tradične používá pro jazykové nebo komunikačné materiály a zdůrazňuje jejich reprezentatívnost a lingvistický kontext. V AI praxi se pojmy často prekrývají.

Co je balanced corpus?

Kolekce sestavená tak, aby definované žánre, skupiny, období nebo jazyky měli plánované zastoupení. Vyváženost neznamená vždy stejný počet. Musí odpovídat výskumnej otázce nebo cílové populaci a být zdokumentovaná.

Proč je deduplikace důležitá?

Opakované dokumenty mohou prevažovat v učení, zvýšit memorování a kontaminovat test, pokud se stejný text objeví v různých častiach. Deduplikace potřebuje přesnou i približnou shodu a evidenci, protože některé opakování mohou být legitimní verze.

Jaké licenčné údaje se mají ukladat?

Zdroj, držitel práv, typ licence, datum získání, povolený účel, povinnost atribuce a prípadné omezení dalšího šíření. Při zmiešanom korpuse musí být licence dostupná na úrovni dokumentu, ne pouze pro celý priečinok.

Jak se zabrání kontaminaci benchmarku?

Testovací otázky a jejich parafráze se odstraní z tréninkového korpusu pomocí přesné a fuzzy kontroly. Sleduje se i čas publikování a přístup modelu k verejným riešeniam. Bez této kontroly může výsledek měřit zapametání, ne generalizaci.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Jurafsky a Martin, Speech and Language Processing
  • NIST AI Risk Management Framework

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.