Odborná definice
Odborná definice
Vocabulary v jazykovém modeli je konečná množina tokenů, kterým tokenizer přiřazuje celočíselné identifikátory a model embeddingové nebo výstupní parametry. Může obsahovat celé slova, subword jednotky, bajty, interpunkci a špeciálne tokeny. Je výsledkem algoritmu tokenizace, tréninkového korpusu, normalizace a pravidel pro coverage. Vocabulary neurčuje význam slov jako lexikografický slovník, ale základní symboly výpočtu. Změna pořadí nebo obsahu tokenů bez úpravy váh poškodí kompatibilitu checkpointu.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Jazykový model nečíta text přímo po slovech. Tokenizer ho rozdělí na jednotky ze svojho pevného seznamu a každou nahradí číslem. Běžné slovo může mít jeden token, vzácně jméno více kúsků a emoji sekvenci bajtů. Slovník ovlivňuje délku promptu, rychlost i to, jako lahko model zpracovává konkrétní jazyk nebo kód. Pokud se token s ID 125 v novém slovníku změní, starý embedding na této pozici už reprezentuje jinou jedničku a model přestane správně dekódovat text.
Časté otázky
Časté otázky
Obsahuje vocabulary všechny slova jazyka?
Ne. Subword tokenizace skládá vzácně slova z menších jednotek, takže konečný slovník dokáže reprezentovat prakticky neobmedzené řetězce.
Co jsou special tokens?
Riadiace symboly pro začiatok, koniec, padding, maskování, roly správ nebo oddělení segmentů. Jejich význam je definovaný architekturou a tréninkem.
Proč má stejný text v různých modelech jiný počet tokenů?
Modely používají odlišný korpus, normalizaci, algoritmus a velikost slovníka. Rozdíl je výrazný při diakritike, kóde, číslach a méně zastúpených jazycích.
Lze vocabulary rozšírit po tréninku?
Technicky lze přidat tokeny a nové embeddingy, ale ty nemají naučený význam. Potřebné je další učení a kontrola, zda se nezhoršia původní tokeny.
Co znamená out-of-vocabulary token?
Při word-level modelech jde o neznámé slovo nahradené symbolom UNK. Bajtové a subword tokenizéry obvykle řetězec rozložia bez úplného OOV.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- SentencePiece: A simple and language independent subword tokenizer
- Hugging Face, Tokenizers documentation
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
