Návrh tokenizerů a modelů

velikost slovníka tokenů

Vocabulary size je počet rozlišovaných tokenů včetně špeciálnych symbolů, pro které model udržuje řádky vstupní embeddingovej a často i výstupní projekčnej matice. Větší slovník může skrátit sekvence a zachytit časté morfémy nebo celé slova, ale zvečšuje počet parametrů a vytváří riedko pozorované tokeny. Menší slovník zvyšuje počet tokenů na text a náklady attention, ale zlepšuje sdílení mezi tvarmi. Optimální velikost závisí na jazyků, domény, modelu a výpočtového rozpočtu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-21

Odborná definice

Odborná definice

Vocabulary size je počet rozlišovaných tokenů včetně špeciálnych symbolů, pro které model udržuje řádky vstupní embeddingovej a často i výstupní projekčnej matice. Větší slovník může skrátit sekvence a zachytit časté morfémy nebo celé slova, ale zvečšuje počet parametrů a vytváří riedko pozorované tokeny. Menší slovník zvyšuje počet tokenů na text a náklady attention, ale zlepšuje sdílení mezi tvarmi. Optimální velikost závisí na jazyků, domény, modelu a výpočtového rozpočtu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si stavebnicu. Velká sada obsahuje hotové diely pro celé slova, takže větu poskladáte z menšieho počtu kusů, ale musíte skladovat obrovské množství špeciálnych dielů. Malá sada používá univerzálnejšie kúsky, z kterých se dá postavit vše, ale výsledná sekvence je dlhšia. Při jazykovém modeli větší slovník zvečší embeddingy a výstupný softmax, menší slovník zaťaží kontextové okno. Rozhodnutí se proto testuje na tokenovej efektivite i kvalite úloh.

Časté otázky

Časté otázky

Je větší vocabulary size vždy lepší pro více jazyků?

Ne. Pokud jsou tokeny rozdělené nerovnomerne, dominantný jazyk může spotrebovat večšinu kapacity. Důležitý je korpus, sampling a coverage jednotlivých písiem.

Jako velikost slovníka ovlivní počet parametrů?

Embeddingová matice má přibližně vocabulary size krát hidden dimension parametrů. Při neviazanej výstupní hlave vzniká další podobně velká matice.

Proč menší slovník predlžuje kontext?

Jedno slovo se rozdělí na více subwordů nebo bajtů. Stejný dokument potom spotrebuje více pozic a zvyšuje výpočty attention.

Jak se vybírá cílová velikost při Sentencepiece?

Nastaví se jako tréninkový hyperparameter a ověří se na tokenech na znak, coverage, downstream výkone a podiele velmi vzácných jednotek.

Mohou být nepoužívané tokeny odstránené z hotového modelu?

Ano, ale je třeba současně prerezat embeddingy, výstupnou hlavu a tokenizer mapování. Změna může porušit kompatibilitu s checkpointmi a API.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • SentencePiece repository and training options Scaling Laws for Neural Language Models

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.