Jazykové modely a tokenizace

základní jednotka zpracování modelu

Token je diskrétna jednotka, na kterou tokenizer převede vstup před spracováním modelem. Může představovat celé slovo, část slova, znak, bajt nebo špeciálny symbol. Každý token se mapuje na celočíselný identifikátor a následně na embedding. Počet tokenů není totožný s počtem slov ani znaků a závisí na konkrétního slovníka a pravidel tokenizace. Limity kontextu, výpočetní náklady i účtování API se proto často vyjadrují v tokenech. Počet tokenů se měří stejnou verzí tokenizéra, jakou používá produkční model a konkrétní endpoint.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-15

Odborná definice

Odborná definice

Token je diskrétna jednotka, na kterou tokenizer převede vstup před spracováním modelem. Může představovat celé slovo, část slova, znak, bajt nebo špeciálny symbol. Každý token se mapuje na celočíselný identifikátor a následně na embedding. Počet tokenů není totožný s počtem slov ani znaků a závisí na konkrétního slovníka a pravidel tokenizace. Limity kontextu, výpočetní náklady i účtování API se proto často vyjadrují v tokenech. Počet tokenů se měří stejnou verzí tokenizéra, jakou používá produkční model a konkrétní endpoint.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Model nečíta větu přímo jako člověk. Tokenizer ji rozdělí na kúsky, které pozná jeho slovník. Běžné slovo může být jeden token, vzácné jméno několik částí a emoji více bajtových jednotek. Stejný text může mít v dvou modelech odlišný počet tokenů. To ovlivní, kolik dokumentu se zmestí do kontextu a kolik bude požadavek stáť. Při spracování slovenčiny se vyplatí měřit reálný tokenizer, protože skloňování a diakritika mohou vést k jinému delení než v angličtine. Odhad podle slov může při kóde, tabulke nebo méně zastúpenom jazyku výrazně podcenit skutečnou délku.

Časté otázky

Časté otázky

Je token vždy část slova?

Ne. Podle tokenizéra může být token celé slovo, subword, interpunkce, medzera, znak, bajt nebo špeciálny riadiaci symbol.

Proč má slovenský text více tokenů než anglický?

Závisí na zastoupení jazyků při tvorbě slovníka a od morfológie. Méně časté tvary se rozkladají na více subword nebo bajtových jednotek.

Co je token ID?

Je to celé číslo, které identifikuje položku v slovníku tokenizéra. Model pracuje s ID a embeddingami, ne s původným reťazcom znaků.

Jak se počítají obrazové nebo zvukové tokeny?

Multimodální modely mohou obraz či zvuk previesť na diskrétní nebo latentní jednotky. Přesný způsob a účtování závisí na architektury a rozhraní.

Může změna tokenizéra změnit model?

Ano. Mění se slovník, délka sekvencí a mapování textu na ID. Model s novým tokenizérom potřebuje kompatibilní embeddingy a obvykle další trénink.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Hugging Face Tokenizer documentation
  • OpenAI Tokenizer

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.