Generatívna a jazyková AI · Tokenizácia a jazykové modely

Slovník tokenov

Vocabulary

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-20

Odborná definícia

Význam a odborné vymedzenie pojmu

Vocabulary v jazykovom modeli je konečná množina tokenov, ktorým tokenizer priraďuje celočíselné identifikátory a model embeddingové alebo výstupné parametre. Môže obsahovať celé slová, subword jednotky, bajty, interpunkciu a špeciálne tokeny. Je výsledkom algoritmu tokenizácie, tréningového korpusu, normalizácie a pravidiel pre coverage. Vocabulary neurčuje význam slov ako lexikografický slovník, ale základné symboly výpočtu. Zmena poradia alebo obsahu tokenov bez úpravy váh poškodí kompatibilitu checkpointu.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Jazykový model nečíta text priamo po slovách. Tokenizer ho rozdelí na jednotky zo svojho pevného zoznamu a každú nahradí číslom. Bežné slovo môže mať jeden token, vzácne meno viac kúskov a emoji sekvenciu bajtov. Slovník ovplyvňuje dĺžku promptu, rýchlosť aj to, ako ľahko model spracúva konkrétny jazyk alebo kód. Ak sa token s ID 125 v novom slovníku zmení, starý embedding na tejto pozícii už reprezentuje inú jednotku a model prestane správne dekódovať text.

Časté otázky

Otázky, ktoré spresňujú význam

Obsahuje vocabulary všetky slová jazyka?

Nie. Subword tokenizácia skladá vzácne slová z menších jednotiek, takže konečný slovník dokáže reprezentovať prakticky neobmedzené reťazce.

Čo sú special tokens?

Riadiace symboly pre začiatok, koniec, padding, maskovanie, roly správ alebo oddelenie segmentov. Ich význam je definovaný architektúrou a tréningom.

Prečo má rovnaký text v rôznych modeloch iný počet tokenov?

Modely používajú odlišný korpus, normalizáciu, algoritmus a veľkosť slovníka. Rozdiel je výrazný pri diakritike, kóde, číslach a menej zastúpených jazykoch.

Dá sa vocabulary rozšíriť po tréningu?

Technicky možno pridať tokeny a nové embeddingy, ale tie nemajú naučený význam. Potrebné je ďalšie učenie a kontrola, či sa nezhoršia pôvodné tokeny.

Čo znamená out-of-vocabulary token?

Pri word-level modeloch ide o neznáme slovo nahradené symbolom UNK. Bajtové a subword tokenizéry zvyčajne reťazec rozložia bez úplného OOV.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • SentencePiece: A simple and language independent subword tokenizer
  • Hugging Face, Tokenizers documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.