Tokenizace a jazykové modely

slovník tokenů

Vocabulary v jazykovém modeli je konečná množina tokenů, kterým tokenizer přiřazuje celočíselné identifikátory a model embeddingové nebo výstupní parametry. Může obsahovat celé slova, subword jednotky, bajty, interpunkci a špeciálne tokeny. Je výsledkem algoritmu tokenizace, tréninkového korpusu, normalizace a pravidel pro coverage. Vocabulary neurčuje význam slov jako lexikografický slovník, ale základní symboly výpočtu. Změna pořadí nebo obsahu tokenů bez úpravy váh poškodí kompatibilitu checkpointu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-20

Odborná definice

Odborná definice

Vocabulary v jazykovém modeli je konečná množina tokenů, kterým tokenizer přiřazuje celočíselné identifikátory a model embeddingové nebo výstupní parametry. Může obsahovat celé slova, subword jednotky, bajty, interpunkci a špeciálne tokeny. Je výsledkem algoritmu tokenizace, tréninkového korpusu, normalizace a pravidel pro coverage. Vocabulary neurčuje význam slov jako lexikografický slovník, ale základní symboly výpočtu. Změna pořadí nebo obsahu tokenů bez úpravy váh poškodí kompatibilitu checkpointu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Jazykový model nečíta text přímo po slovech. Tokenizer ho rozdělí na jednotky ze svojho pevného seznamu a každou nahradí číslem. Běžné slovo může mít jeden token, vzácně jméno více kúsků a emoji sekvenci bajtů. Slovník ovlivňuje délku promptu, rychlost i to, jako lahko model zpracovává konkrétní jazyk nebo kód. Pokud se token s ID 125 v novém slovníku změní, starý embedding na této pozici už reprezentuje jinou jedničku a model přestane správně dekódovat text.

Časté otázky

Časté otázky

Obsahuje vocabulary všechny slova jazyka?

Ne. Subword tokenizace skládá vzácně slova z menších jednotek, takže konečný slovník dokáže reprezentovat prakticky neobmedzené řetězce.

Co jsou special tokens?

Riadiace symboly pro začiatok, koniec, padding, maskování, roly správ nebo oddělení segmentů. Jejich význam je definovaný architekturou a tréninkem.

Proč má stejný text v různých modelech jiný počet tokenů?

Modely používají odlišný korpus, normalizaci, algoritmus a velikost slovníka. Rozdíl je výrazný při diakritike, kóde, číslach a méně zastúpených jazycích.

Lze vocabulary rozšírit po tréninku?

Technicky lze přidat tokeny a nové embeddingy, ale ty nemají naučený význam. Potřebné je další učení a kontrola, zda se nezhoršia původní tokeny.

Co znamená out-of-vocabulary token?

Při word-level modelech jde o neznámé slovo nahradené symbolom UNK. Bajtové a subword tokenizéry obvykle řetězec rozložia bez úplného OOV.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • SentencePiece: A simple and language independent subword tokenizer
  • Hugging Face, Tokenizers documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.