Odborná definícia
Význam a odborné vymedzenie pojmu
Byte pair encoding v NLP je subword tokenizačná metóda, ktorá začína základnými symbolmi a iteratívne spája najčastejšie susedné dvojice do nových tokenov. Výsledný slovník obsahuje celé časté slová, časti slov aj základné jednotky pre zriedkavé tvary. Praktické implementácie môžu pracovať nad znakmi alebo bajtmi a používajú naučené poradie merge operácií. BPE znižuje problém neznámych slov, ale segmentácia nie je morfologická analýza. Voľba korpusu a veľkosti slovníka ovplyvňuje dĺžku sekvencií, pokrytie jazykov, cenu inferencie a spracovanie citlivých reťazcov.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Tokenizér môže slovo „najpravdepodobnejší“ rozdeliť na niekoľko opakujúcich sa častí namiesto uloženia každého tvaru ako samostatného slova. Počas učenia sleduje, ktoré dvojice symbolov sa často objavujú spolu, a postupne ich spája. Bežné slová môžu zostať jedným tokenom, zriedkavé sa rozložia. Model tak zvládne nové mená alebo tvary, ale dlhé slovenské slovo môže spotrebovať viac tokenov než anglické. To ovplyvňuje kontextové okno aj cenu. BPE hranice zároveň nemusia zodpovedať predponám, koreňom alebo významovým častiam.
Časté otázky
Otázky, ktoré spresňujú význam
Je BPE kompresný algoritmus alebo tokenizér?
Pôvodný názov pochádza z kompresie, kde sa nahrádzajú časté páry. V NLP sa princíp používa na naučenie subword slovníka. Cieľom nie je iba kompresia súboru, ale reprezentácia otvoreného slovníka pre model.
Čím sa byte-level BPE líši od character BPE?
Byte-level verzia začína bajtmi, takže dokáže reprezentovať ľubovoľný text bez unknown tokenu. Character verzia pracuje nad znakmi a potrebuje pravidlá pre znakový repertoár. Bajty môžu pri niektorých skriptoch vytvoriť dlhšie sekvencie.
Prečo tokenizácia ovplyvňuje cenu LLM?
Model počíta nad tokenmi, nie nad slovami. Jazyk alebo formát, ktorý sa rozkladá na viac tokenov, spotrebuje väčšie kontextové okno a viac výpočtu. Cena a latencia preto závisia aj od konkrétneho tokenizéra.
Môže BPE rozbiť citlivé údaje na zvláštne časti?
Áno. E-mail, identifikátor alebo číslo môže byť rozdelené na viac tokenov. Tokenizácia údaje neanonymizuje. Logy tokenov a embeddingy treba chrániť podľa významu pôvodného obsahu, nie podľa segmentácie.
Ako sa vyberá veľkosť BPE slovníka?
Väčší slovník skracuje sekvencie pre časté výrazy, ale zväčšuje embeddingovú a výstupnú vrstvu a môže horšie pokryť menšinové vzory. Voľba sa testuje podľa jazykov, domény, pamäte a downstream výkonu.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Sennrich, Haddow a Birch, Neural Machine Translation of Rare Words with Subword Units Devlin a kol., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
