Odborná definice
Odborná definice
Tokenizer je komponenta, který normalizuje a segmentuje text na tokeny, mapuje jejich na identifikátory a vytváří pomocné údaje, například attention masku, offsety nebo špeciálne tokeny. Jeho slovník a algoritmus, například BPE, Wordpiece, Unigram nebo bajtové kódování, jsou součástí modelového kontraktu. Tokenizer ovlivňuje délku sekvence, zpracování jazyků, hranice slov a zpětné dekódování. Nekompatibilný tokenizer může zcela znehodnotit modelové váhy. Verze tokenizéra, normalizačné pravidla a soubory slovníka patří do stejného artefaktu jako modelové váhy.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Tokenizér je prekladatel mezi textem a číslami modelu. Nejprve může zjednotit znaky, potom rozdělí řetězec na známé kúsky a každému přiřadí ID. Zároveň přidá symbol začátku, konca nebo oddělení vět. Důležité jsou i offsety, které říkají, které znaky původního textu patří ku konkrétnímu tokenu. Bez nich se těžko vracají entity nebo citace na přesné místo. Dva modely mohou používat stejnou architekturu, ale odlišný slovník, proto jejich tokenizéry nelze svojvolne zaměnit. Reprodukce selže, pokud se text před modelem rozdělí co i jen mírně jinak než během tréninku.
Časté otázky
Časté otázky
Co je BPE tokenizace?
Byte Pair Encoding iterativně spojuje často se vyskytujúce sousední jednotky. Vytvoří kompaktný subword slovník, který zachová celé běžné slova a rozloží vzácné.
K čemu slouží special tokens?
Označují začiatok, koniec, padding, masku, rolu nebo oddělení segmentů. Jejich ID a umístění musí odpovídat způsobu, jakým byl model trénovaný.
Co je attention mask?
Je to sprievodná maska určujúca, které pozice jsou skutečný obsah a které padding, případně které tokeny se smú navzájem pozorovat.
Proč jsou offset mappings důležité?
Mapují tokeny na rozsahy znaků v původním textu. Umožňují označit přesné entity, zvýraznit zdroj nebo spojit subword predikce do slov.
Lze tokenizer trénovat samostatně?
Ano. Vytváří se z reprezentatívneho korpusu s cílovou velikostí slovníka a normalizačnými pravidly. Následně se model trénuje nebo prispůsobí tomuto slovníku.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Hugging Face Tokenizer documentation
- Hugging Face, Tokenization Algorithms
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
