Generatívna a jazyková AI · Jazykové modely a tokenizácia

Základná jednotka spracovania modelu

Token

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-15

Odborná definícia

Význam a odborné vymedzenie pojmu

Token je diskrétna jednotka, na ktorú tokenizer prevedie vstup pred spracovaním modelom. Môže predstavovať celé slovo, časť slova, znak, bajt alebo špeciálny symbol. Každý token sa mapuje na celočíselný identifikátor a následne na embedding. Počet tokenov nie je totožný s počtom slov ani znakov a závisí od konkrétneho slovníka a pravidiel tokenizácie. Limity kontextu, výpočtové náklady aj účtovanie API sa preto často vyjadrujú v tokenoch. Počet tokenov sa meria rovnakou verziou tokenizéra, akú používa produkčný model a konkrétny endpoint.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Model nečíta vetu priamo ako človek. Tokenizer ju rozdelí na kúsky, ktoré pozná jeho slovník. Bežné slovo môže byť jeden token, zriedkavé meno niekoľko častí a emoji viac bajtových jednotiek. Rovnaký text môže mať v dvoch modeloch odlišný počet tokenov. To ovplyvní, koľko dokumentu sa zmestí do kontextu a koľko bude požiadavka stáť. Pri spracovaní slovenčiny sa oplatí merať reálny tokenizer, pretože skloňovanie a diakritika môžu viesť k inému deleniu než v angličtine. Odhad podľa slov môže pri kóde, tabuľke alebo menej zastúpenom jazyku výrazne podceniť skutočnú dĺžku.

Časté otázky

Otázky, ktoré spresňujú význam

Je token vždy časť slova?

Nie. Podľa tokenizéra môže byť token celé slovo, subword, interpunkcia, medzera, znak, bajt alebo špeciálny riadiaci symbol.

Prečo má slovenský text viac tokenov než anglický?

Závisí od zastúpenia jazykov pri tvorbe slovníka a od morfológie. Menej časté tvary sa rozkladajú na viac subword alebo bajtových jednotiek.

Čo je token ID?

Je to celé číslo, ktoré identifikuje položku v slovníku tokenizéra. Model pracuje s ID a embeddingami, nie s pôvodným reťazcom znakov.

Ako sa počítajú obrazové alebo zvukové tokeny?

Multimodálne modely môžu obraz či zvuk previesť na diskrétne alebo latentné jednotky. Presný spôsob a účtovanie závisia od architektúry a rozhrania.

Môže zmena tokenizéra zmeniť model?

Áno. Mení sa slovník, dĺžka sekvencií a mapovanie textu na ID. Model s novým tokenizérom potrebuje kompatibilné embeddingy a zvyčajne ďalší tréning.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Hugging Face Tokenizer documentation
  • OpenAI Tokenizer

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.