Návrh tokenizerov a modelov

Vocabulary size

veľkosť slovníka tokenov

Vocabulary size je počet rozlišovaných tokenov vrátane špeciálnych symbolov, pre ktoré model udržiava riadky vstupnej embeddingovej a často aj výstupnej projekčnej matice. Väčší slovník môže skrátiť sekvencie a zachytiť časté morfémy alebo celé slová, no zväčšuje počet parametrov a vytvára riedko pozorované tokeny. Menší slovník zvyšuje počet tokenov na text a náklady attention, ale zlepšuje zdieľanie medzi tvarmi. Optimálna veľkosť závisí od jazykov, domény, modelu a výpočtového rozpočtu.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-21

Odborná definícia

Odborná definícia

Vocabulary size je počet rozlišovaných tokenov vrátane špeciálnych symbolov, pre ktoré model udržiava riadky vstupnej embeddingovej a často aj výstupnej projekčnej matice. Väčší slovník môže skrátiť sekvencie a zachytiť časté morfémy alebo celé slová, no zväčšuje počet parametrov a vytvára riedko pozorované tokeny. Menší slovník zvyšuje počet tokenov na text a náklady attention, ale zlepšuje zdieľanie medzi tvarmi. Optimálna veľkosť závisí od jazykov, domény, modelu a výpočtového rozpočtu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Predstavte si stavebnicu. Veľká sada obsahuje hotové diely pre celé slová, takže vetu poskladáte z menšieho počtu kusov, ale musíte skladovať obrovské množstvo špeciálnych dielov. Malá sada používa univerzálnejšie kúsky, z ktorých sa dá postaviť všetko, no výsledná sekvencia je dlhšia. Pri jazykovom modeli väčší slovník zväčší embeddingy a výstupný softmax, menší slovník zaťaží kontextové okno. Rozhodnutie sa preto testuje na tokenovej efektivite aj kvalite úloh.

Časté otázky

Časté otázky

Je väčší vocabulary size vždy lepší pre viac jazykov?

Nie. Ak sú tokeny rozdelené nerovnomerne, dominantný jazyk môže spotrebovať väčšinu kapacity. Dôležitý je korpus, sampling a coverage jednotlivých písiem.

Ako veľkosť slovníka ovplyvní počet parametrov?

Embeddingová matica má približne vocabulary size krát hidden dimension parametrov. Pri neviazanej výstupnej hlave vzniká ďalšia podobne veľká matica.

Prečo menší slovník predlžuje kontext?

Jedno slovo sa rozdelí na viac subwordov alebo bajtov. Rovnaký dokument potom spotrebuje viac pozícií a zvyšuje výpočty attention.

Ako sa vyberá cieľová veľkosť pri SentencePiece?

Nastaví sa ako tréningový hyperparameter a overí sa na tokenoch na znak, coverage, downstream výkone a podiele veľmi vzácnych jednotiek.

Môžu byť nepoužívané tokeny odstránené z hotového modelu?

Áno, ale treba súčasne prerezať embeddingy, výstupnú hlavu a tokenizer mapovanie. Zmena môže porušiť kompatibilitu s checkpointmi a API.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • SentencePiece repository and training options Scaling Laws for Neural Language Models

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.