Predspracovanie textu

Tokenizer

Tokenizer je komponent, ktorý normalizuje a segmentuje text na tokeny, mapuje ich na identifikátory a vytvára pomocné údaje, napríklad attention masku, offsety alebo špeciálne tokeny. Jeho slovník a algoritmus, napríklad BPE, WordPiece, Unigram alebo bajtové kódovanie, sú súčasťou modelového kontraktu. Tokenizer ovplyvňuje dĺžku sekvencie, spracovanie jazykov, hranice slov a spätné dekódovanie. Nekompatibilný tokenizer môže úplne znehodnotiť modelové váhy. Verzia tokenizéra, normalizačné pravidlá a súbory slovníka patria do rovnakého artefaktu ako modelové váhy.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-19

Odborná definícia

Odborná definícia

Tokenizer je komponent, ktorý normalizuje a segmentuje text na tokeny, mapuje ich na identifikátory a vytvára pomocné údaje, napríklad attention masku, offsety alebo špeciálne tokeny. Jeho slovník a algoritmus, napríklad BPE, WordPiece, Unigram alebo bajtové kódovanie, sú súčasťou modelového kontraktu. Tokenizer ovplyvňuje dĺžku sekvencie, spracovanie jazykov, hranice slov a spätné dekódovanie. Nekompatibilný tokenizer môže úplne znehodnotiť modelové váhy. Verzia tokenizéra, normalizačné pravidlá a súbory slovníka patria do rovnakého artefaktu ako modelové váhy.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Tokenizér je prekladateľ medzi textom a číslami modelu. Najprv môže zjednotiť znaky, potom rozdelí reťazec na známe kúsky a každému priradí ID. Zároveň pridá symbol začiatku, konca alebo oddelenia viet. Dôležité sú aj offsety, ktoré hovoria, ktoré znaky pôvodného textu patria ku konkrétnemu tokenu. Bez nich sa ťažko vracajú entity alebo citácie na presné miesto. Dva modely môžu používať rovnakú architektúru, ale odlišný slovník, preto ich tokenizéry nemožno svojvoľne zameniť. Reprodukcia zlyhá, ak sa text pred modelom rozdelí čo i len mierne inak než počas tréningu.

Časté otázky

Časté otázky

Čo je BPE tokenizácia?

Byte Pair Encoding iteratívne spája často sa vyskytujúce susedné jednotky. Vytvorí kompaktný subword slovník, ktorý zachová celé bežné slová a rozloží zriedkavé.

Načo slúžia special tokens?

Označujú začiatok, koniec, padding, masku, rolu alebo oddelenie segmentov. Ich ID a umiestnenie musia zodpovedať spôsobu, akým bol model trénovaný.

Čo je attention mask?

Je to sprievodná maska určujúca, ktoré pozície sú skutočný obsah a ktoré padding, prípadne ktoré tokeny sa smú navzájom pozorovať.

Prečo sú offset mappings dôležité?

Mapujú tokeny na rozsahy znakov v pôvodnom texte. Umožňujú označiť presné entity, zvýrazniť zdroj alebo spojiť subword predikcie do slov.

Dá sa tokenizer trénovať samostatne?

Áno. Vytvára sa z reprezentatívneho korpusu s cieľovou veľkosťou slovníka a normalizačnými pravidlami. Následne sa model trénuje alebo prispôsobí tomuto slovníku.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Hugging Face Tokenizer documentation
  • Hugging Face, Tokenization Algorithms

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.