Tokenizácia a jazykové modelovanie

Unigram language model

unigramový pravdepodobnostný model segmentácie

Unigram language model v tokenizácii predpokladá, že text vzniká postupnosťou subword jednotiek, z ktorých každá má vlastnú pravdepodobnosť nezávislú od susedov. Tréning začína veľkým kandidátskym slovníkom a opakovane odstraňuje jednotky s malým prínosom k pravdepodobnosti korpusu, kým nedosiahne cieľovú veľkosť. Jedna veta môže mať viac platných segmentácií a algoritmus vyberie najpravdepodobnejšiu alebo vzorkuje alternatívy. Nejde o klasický n-gram model ďalšieho slova. Tokenizačný model sa verzuje spolu s normalizáciou a slovníkom, pretože zmena segmentácie mení všetky vstupy neurónovej siete.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-12

Odborná definícia

Odborná definícia

Unigram language model v tokenizácii predpokladá, že text vzniká postupnosťou subword jednotiek, z ktorých každá má vlastnú pravdepodobnosť nezávislú od susedov. Tréning začína veľkým kandidátskym slovníkom a opakovane odstraňuje jednotky s malým prínosom k pravdepodobnosti korpusu, kým nedosiahne cieľovú veľkosť. Jedna veta môže mať viac platných segmentácií a algoritmus vyberie najpravdepodobnejšiu alebo vzorkuje alternatívy. Nejde o klasický n-gram model ďalšieho slova. Tokenizačný model sa verzuje spolu s normalizáciou a slovníkom, pretože zmena segmentácie mení všetky vstupy neurónovej siete.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Slovo môže byť rozdelené na celé slovo, koreň a príponu alebo na kratšie kúsky. Unigramový tokenizér má zoznam možných kúskov a pri každom pravdepodobnosť. Pre celú vetu hľadá kombináciu, ktorá má najvyššie spoločné skóre. Počas tréningu postupne vyhadzuje jednotky, bez ktorých sa korpus dá stále dobre vysvetliť. Výhodou je pružná segmentácia a možnosť samplingom vytvárať viac variantov, čo môže zvýšiť robustnosť modelu voči pravopisu a morfológii. Pri migrácii sa musia prepočítať sekvencie, embeddingy aj dĺžkové limity, nestačí vymeniť jeden súbor tokenizéra.

Časté otázky

Časté otázky

Ako sa unigram tokenizácia líši od BPE?

BPE deterministicky spája často susediace symboly podľa naučených merge pravidiel. Unigram začína množinou kandidátov a optimalizuje pravdepodobnostný slovník segmentov.

Prečo môže mať veta viac segmentácií?

Rovnaký reťazec možno poskladať z rôznych subword jednotiek. Model priradí každej možnosti pravdepodobnosť a dekóder zvolí najlepšiu alebo vzorku.

Čo je subword regularization?

Počas tréningu jazykového modelu sa náhodne vzorkujú alternatívne segmentácie. Model tak nie je viazaný na jediný rozklad a môže lepšie zvládať vzácne tvary.

Ako sa určí veľkosť slovníka?

Je to hyperparameter tokenizéra. Menší slovník predlžuje sekvencie, väčší zvyšuje embeddingovú maticu a môže vytvárať málo používané jednotky.

Je unigram model vhodný pre slovenčinu?

Môže dobre zachytiť morfologické časti, no výsledok závisí od korpusu, normalizácie a character coverage. Kvalita sa hodnotí aj na menách, skratkách a diakritike.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates SentencePiece repository and documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.