Jazykové dáta a znalostné zdroje

Corpus

Textový alebo multimodálny korpus

Corpus je systematicky zhromaždená kolekcia jazykových alebo multimodálnych dát určená na výskum, tréning, evaluáciu alebo vyhľadávanie. Môže obsahovať dokumenty, prepisy reči, dialógy, anotácie, obrázky s popismi a metadáta o pôvode, jazyku, čase a licencii. Korpus nie je iba priečinok súborov, jeho použiteľnosť závisí od kritérií výberu, reprezentatívnosti, deduplikácie, kvality anotácií a dokumentácie. Rovnaký obsah môže byť vhodný pre fulltext, ale nevhodný na tréning modelu pre právne, súkromné alebo metodické obmedzenia.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-22

Odborná definícia

Odborná definícia

Corpus je systematicky zhromaždená kolekcia jazykových alebo multimodálnych dát určená na výskum, tréning, evaluáciu alebo vyhľadávanie. Môže obsahovať dokumenty, prepisy reči, dialógy, anotácie, obrázky s popismi a metadáta o pôvode, jazyku, čase a licencii. Korpus nie je iba priečinok súborov, jeho použiteľnosť závisí od kritérií výberu, reprezentatívnosti, deduplikácie, kvality anotácií a dokumentácie. Rovnaký obsah môže byť vhodný pre fulltext, ale nevhodný na tréning modelu pre právne, súkromné alebo metodické obmedzenia.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Ak chcete vytvoriť model pre slovenskú zákaznícku podporu, nestačí stiahnuť náhodné webové stránky. Potrebujete vedieť, aké typy otázok, dialektov, produktov a období kolekcia pokrýva, kto text vytvoril a či ho smiete použiť. Korpus môže obsahovať surové rozhovory, očistenú verziu aj manuálne označené intenty. Každá úprava mení jeho význam. Dobre spravovaný korpus má dátový list, verziu, rozdelenie na tréning a test a proces odstránenia záznamu, keď sa zmení súhlas alebo licencia.

Časté otázky

Časté otázky

Ako sa korpus líši od datasetu?

Dataset je širší pojem pre štruktúrovanú kolekciu dát ľubovoľného typu. Corpus sa tradične používa pre jazykové alebo komunikačné materiály a zdôrazňuje ich reprezentatívnosť a lingvistický kontext. V AI praxi sa pojmy často prekrývajú.

Čo je balanced corpus?

Kolekcia zostavená tak, aby definované žánre, skupiny, obdobia alebo jazyky mali plánované zastúpenie. Vyváženosť neznamená vždy rovnaký počet. Musí zodpovedať výskumnej otázke alebo cieľovej populácii a byť zdokumentovaná.

Prečo je deduplikácia dôležitá?

Opakované dokumenty môžu prevažovať v učení, zvýšiť memorovanie a kontaminovať test, ak sa rovnaký text objaví v rôznych častiach. Deduplikácia potrebuje presnú aj približnú zhodu a evidenciu, pretože niektoré opakovania môžu byť legitímne verzie.

Aké licenčné údaje sa majú ukladať?

Zdroj, držiteľ práv, typ licencie, dátum získania, povolený účel, povinnosť atribúcie a prípadné obmedzenie ďalšieho šírenia. Pri zmiešanom korpuse musí byť licencia dostupná na úrovni dokumentu, nie iba pre celý priečinok.

Ako sa zabráni kontaminácii benchmarku?

Testovacie otázky a ich parafrázy sa odstránia z tréningového korpusu pomocou presnej a fuzzy kontroly. Sleduje sa aj čas publikovania a prístup modelu k verejným riešeniam. Bez tejto kontroly môže výsledok merať zapamätanie, nie generalizáciu.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Jurafsky a Martin, Speech and Language Processing
  • NIST AI Risk Management Framework

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.