Generatívna a jazyková AI · Tokenizácia a jazykové modely

BPE tokenizácia

Byte pair encoding

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-B-25

Odborná definícia

Význam a odborné vymedzenie pojmu

Byte pair encoding v NLP je subword tokenizačná metóda, ktorá začína základnými symbolmi a iteratívne spája najčastejšie susedné dvojice do nových tokenov. Výsledný slovník obsahuje celé časté slová, časti slov aj základné jednotky pre zriedkavé tvary. Praktické implementácie môžu pracovať nad znakmi alebo bajtmi a používajú naučené poradie merge operácií. BPE znižuje problém neznámych slov, ale segmentácia nie je morfologická analýza. Voľba korpusu a veľkosti slovníka ovplyvňuje dĺžku sekvencií, pokrytie jazykov, cenu inferencie a spracovanie citlivých reťazcov.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Tokenizér môže slovo „najpravdepodobnejší“ rozdeliť na niekoľko opakujúcich sa častí namiesto uloženia každého tvaru ako samostatného slova. Počas učenia sleduje, ktoré dvojice symbolov sa často objavujú spolu, a postupne ich spája. Bežné slová môžu zostať jedným tokenom, zriedkavé sa rozložia. Model tak zvládne nové mená alebo tvary, ale dlhé slovenské slovo môže spotrebovať viac tokenov než anglické. To ovplyvňuje kontextové okno aj cenu. BPE hranice zároveň nemusia zodpovedať predponám, koreňom alebo významovým častiam.

Časté otázky

Otázky, ktoré spresňujú význam

Je BPE kompresný algoritmus alebo tokenizér?

Pôvodný názov pochádza z kompresie, kde sa nahrádzajú časté páry. V NLP sa princíp používa na naučenie subword slovníka. Cieľom nie je iba kompresia súboru, ale reprezentácia otvoreného slovníka pre model.

Čím sa byte-level BPE líši od character BPE?

Byte-level verzia začína bajtmi, takže dokáže reprezentovať ľubovoľný text bez unknown tokenu. Character verzia pracuje nad znakmi a potrebuje pravidlá pre znakový repertoár. Bajty môžu pri niektorých skriptoch vytvoriť dlhšie sekvencie.

Prečo tokenizácia ovplyvňuje cenu LLM?

Model počíta nad tokenmi, nie nad slovami. Jazyk alebo formát, ktorý sa rozkladá na viac tokenov, spotrebuje väčšie kontextové okno a viac výpočtu. Cena a latencia preto závisia aj od konkrétneho tokenizéra.

Môže BPE rozbiť citlivé údaje na zvláštne časti?

Áno. E-mail, identifikátor alebo číslo môže byť rozdelené na viac tokenov. Tokenizácia údaje neanonymizuje. Logy tokenov a embeddingy treba chrániť podľa významu pôvodného obsahu, nie podľa segmentácie.

Ako sa vyberá veľkosť BPE slovníka?

Väčší slovník skracuje sekvencie pre časté výrazy, ale zväčšuje embeddingovú a výstupnú vrstvu a môže horšie pokryť menšinové vzory. Voľba sa testuje podľa jazykov, domény, pamäte a downstream výkonu.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Sennrich, Haddow a Birch, Neural Machine Translation of Rare Words with Subword Units Devlin a kol., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.