Odborná definícia
Význam a odborné vymedzenie pojmu
Token je diskrétna jednotka, na ktorú tokenizer prevedie vstup pred spracovaním modelom. Môže predstavovať celé slovo, časť slova, znak, bajt alebo špeciálny symbol. Každý token sa mapuje na celočíselný identifikátor a následne na embedding. Počet tokenov nie je totožný s počtom slov ani znakov a závisí od konkrétneho slovníka a pravidiel tokenizácie. Limity kontextu, výpočtové náklady aj účtovanie API sa preto často vyjadrujú v tokenoch. Počet tokenov sa meria rovnakou verziou tokenizéra, akú používa produkčný model a konkrétny endpoint.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Model nečíta vetu priamo ako človek. Tokenizer ju rozdelí na kúsky, ktoré pozná jeho slovník. Bežné slovo môže byť jeden token, zriedkavé meno niekoľko častí a emoji viac bajtových jednotiek. Rovnaký text môže mať v dvoch modeloch odlišný počet tokenov. To ovplyvní, koľko dokumentu sa zmestí do kontextu a koľko bude požiadavka stáť. Pri spracovaní slovenčiny sa oplatí merať reálny tokenizer, pretože skloňovanie a diakritika môžu viesť k inému deleniu než v angličtine. Odhad podľa slov môže pri kóde, tabuľke alebo menej zastúpenom jazyku výrazne podceniť skutočnú dĺžku.
Časté otázky
Otázky, ktoré spresňujú význam
Je token vždy časť slova?
Nie. Podľa tokenizéra môže byť token celé slovo, subword, interpunkcia, medzera, znak, bajt alebo špeciálny riadiaci symbol.
Prečo má slovenský text viac tokenov než anglický?
Závisí od zastúpenia jazykov pri tvorbe slovníka a od morfológie. Menej časté tvary sa rozkladajú na viac subword alebo bajtových jednotiek.
Čo je token ID?
Je to celé číslo, ktoré identifikuje položku v slovníku tokenizéra. Model pracuje s ID a embeddingami, nie s pôvodným reťazcom znakov.
Ako sa počítajú obrazové alebo zvukové tokeny?
Multimodálne modely môžu obraz či zvuk previesť na diskrétne alebo latentné jednotky. Presný spôsob a účtovanie závisia od architektúry a rozhrania.
Môže zmena tokenizéra zmeniť model?
Áno. Mení sa slovník, dĺžka sekvencií a mapovanie textu na ID. Model s novým tokenizérom potrebuje kompatibilné embeddingy a zvyčajne ďalší tréning.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Hugging Face Tokenizer documentation
- OpenAI Tokenizer
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
