Odborná definice
Odborná definice
Byte pair encoding v NLP je subword tokenizačná metoda, která začíná základními symbolmi a iterativně spojuje nejčastěji sousední dvojice do nových tokenů. Výsledný slovník obsahuje celé časté slova, části slov i základní jednotky pro vzácné tvary. Praktické implementace mohou pracovat nad znakmi nebo bajtmi a používají naučené pořadí merge operací. BPE snižuje problém neznámých slov, ale segmentace není morfologická analýza. Volba korpusu a velikosti slovníka ovlivňuje délku sekvencí, pokrytí jazyků, cenu inference a zpracování citlivých reťazců.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Tokenizér může slovo „najpravdepodobnejší“ rozdelit na několik opakujúcich se částí místo uložení každého tvaru jako samostatného slova. Během učení sleduje, které dvojice symbolů se často objavují spolu, a postupně jejich spojuje. Běžné slova mohou zůstat jedním tokenom, vzácné se rozložia. Model tak zvládne nové jména nebo tvary, ale dlouhé slovenské slovo může spotrebovat více tokenů než anglické. To ovlivňuje kontextové okno i cenu. BPE hranice zároveň nemusí odpovídat predponám, koreňom nebo významovým častiam.
Časté otázky
Časté otázky
Je BPE kompresný algoritmus nebo tokenizér?
Původní název pochází z komprese, kde se nahrádzají časté páry. V NLP se princip používá na naučení subword slovníka. Cílem není pouze komprese souboru, ale reprezentace otevřeného slovníka pro model.
Čím se byte-level BPE liší od character BPE?
Byte-level verze začíná bajtmi, takže dokáže reprezentovat libovolný text bez unknown tokenu. Character verze pracuje nad znakmi a potřebuje pravidla pro znakový repertoár. Bajty mohou při některých skriptoch vytvořit déle sekvence.
Proč tokenizace ovlivňuje cenu LLM?
Model počítá nad tokenmi, ne nad slovami. Jazyk nebo formát, který se rozkladá na více tokenů, spotrebuje větší kontextové okno a více výpočtu. Cena a latence proto závisí i od konkrétního tokenizéra.
Může BPE rozbit citlivé údaje na zvláštne části?
Ano. E-mail, identifikátor nebo číslo může být rozdělené na více tokenů. Tokenizace údaje neanonymizuje. Logy tokenů a embeddingy je třeba chránit podle významu původního obsahu, ne podle segmentace.
Jak se vybírá velikost BPE slovníka?
Větší slovník skracuje sekvence pro časté výrazy, ale zvečšuje embeddingovou a výstupnou vrstvu a může hůře pokrýt menšinové vzory. Volba se testuje podle jazyků, domény, paměti a downstream výkonu.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Sennrich, Haddow a Birch, Neural Machine Translation of Rare Words with Subword Units Devlin a kol., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
