Odborná definice
Odborná definice
Token je diskrétna jednotka, na kterou tokenizer převede vstup před spracováním modelem. Může představovat celé slovo, část slova, znak, bajt nebo špeciálny symbol. Každý token se mapuje na celočíselný identifikátor a následně na embedding. Počet tokenů není totožný s počtem slov ani znaků a závisí na konkrétního slovníka a pravidel tokenizace. Limity kontextu, výpočetní náklady i účtování API se proto často vyjadrují v tokenech. Počet tokenů se měří stejnou verzí tokenizéra, jakou používá produkční model a konkrétní endpoint.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Model nečíta větu přímo jako člověk. Tokenizer ji rozdělí na kúsky, které pozná jeho slovník. Běžné slovo může být jeden token, vzácné jméno několik částí a emoji více bajtových jednotek. Stejný text může mít v dvou modelech odlišný počet tokenů. To ovlivní, kolik dokumentu se zmestí do kontextu a kolik bude požadavek stáť. Při spracování slovenčiny se vyplatí měřit reálný tokenizer, protože skloňování a diakritika mohou vést k jinému delení než v angličtine. Odhad podle slov může při kóde, tabulke nebo méně zastúpenom jazyku výrazně podcenit skutečnou délku.
Časté otázky
Časté otázky
Je token vždy část slova?
Ne. Podle tokenizéra může být token celé slovo, subword, interpunkce, medzera, znak, bajt nebo špeciálny riadiaci symbol.
Proč má slovenský text více tokenů než anglický?
Závisí na zastoupení jazyků při tvorbě slovníka a od morfológie. Méně časté tvary se rozkladají na více subword nebo bajtových jednotek.
Co je token ID?
Je to celé číslo, které identifikuje položku v slovníku tokenizéra. Model pracuje s ID a embeddingami, ne s původným reťazcom znaků.
Jak se počítají obrazové nebo zvukové tokeny?
Multimodální modely mohou obraz či zvuk previesť na diskrétní nebo latentní jednotky. Přesný způsob a účtování závisí na architektury a rozhraní.
Může změna tokenizéra změnit model?
Ano. Mění se slovník, délka sekvencí a mapování textu na ID. Model s novým tokenizérom potřebuje kompatibilní embeddingy a obvykle další trénink.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Hugging Face Tokenizer documentation
- OpenAI Tokenizer
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
