Předzpracování textu

tokenizér

Tokenizer je komponenta, který normalizuje a segmentuje text na tokeny, mapuje jejich na identifikátory a vytváří pomocné údaje, například attention masku, offsety nebo špeciálne tokeny. Jeho slovník a algoritmus, například BPE, Wordpiece, Unigram nebo bajtové kódování, jsou součástí modelového kontraktu. Tokenizer ovlivňuje délku sekvence, zpracování jazyků, hranice slov a zpětné dekódování. Nekompatibilný tokenizer může zcela znehodnotit modelové váhy. Verze tokenizéra, normalizačné pravidla a soubory slovníka patří do stejného artefaktu jako modelové váhy.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-19

Odborná definice

Odborná definice

Tokenizer je komponenta, který normalizuje a segmentuje text na tokeny, mapuje jejich na identifikátory a vytváří pomocné údaje, například attention masku, offsety nebo špeciálne tokeny. Jeho slovník a algoritmus, například BPE, Wordpiece, Unigram nebo bajtové kódování, jsou součástí modelového kontraktu. Tokenizer ovlivňuje délku sekvence, zpracování jazyků, hranice slov a zpětné dekódování. Nekompatibilný tokenizer může zcela znehodnotit modelové váhy. Verze tokenizéra, normalizačné pravidla a soubory slovníka patří do stejného artefaktu jako modelové váhy.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Tokenizér je prekladatel mezi textem a číslami modelu. Nejprve může zjednotit znaky, potom rozdělí řetězec na známé kúsky a každému přiřadí ID. Zároveň přidá symbol začátku, konca nebo oddělení vět. Důležité jsou i offsety, které říkají, které znaky původního textu patří ku konkrétnímu tokenu. Bez nich se těžko vracají entity nebo citace na přesné místo. Dva modely mohou používat stejnou architekturu, ale odlišný slovník, proto jejich tokenizéry nelze svojvolne zaměnit. Reprodukce selže, pokud se text před modelem rozdělí co i jen mírně jinak než během tréninku.

Časté otázky

Časté otázky

Co je BPE tokenizace?

Byte Pair Encoding iterativně spojuje často se vyskytujúce sousední jednotky. Vytvoří kompaktný subword slovník, který zachová celé běžné slova a rozloží vzácné.

K čemu slouží special tokens?

Označují začiatok, koniec, padding, masku, rolu nebo oddělení segmentů. Jejich ID a umístění musí odpovídat způsobu, jakým byl model trénovaný.

Co je attention mask?

Je to sprievodná maska určujúca, které pozice jsou skutečný obsah a které padding, případně které tokeny se smú navzájem pozorovat.

Proč jsou offset mappings důležité?

Mapují tokeny na rozsahy znaků v původním textu. Umožňují označit přesné entity, zvýraznit zdroj nebo spojit subword predikce do slov.

Lze tokenizer trénovat samostatně?

Ano. Vytváří se z reprezentatívneho korpusu s cílovou velikostí slovníka a normalizačnými pravidly. Následně se model trénuje nebo prispůsobí tomuto slovníku.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Hugging Face Tokenizer documentation
  • Hugging Face, Tokenization Algorithms

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.