Tokenizace a jazykové modelování

unigramový pravděpodobnostní model segmentace

Unigram language model v tokenizaci předpokládá, že text vzniká postupností subword jednotek, z kterých každá má vlastní pravděpodobnost nezávislou od sousedů. Trénink začíná velkým kandidátskym slovníkem a opakovaně odstraňuje jednotky s malým přínosem k pravděpodobnosti korpusu, zatímco nedosiahne cílovou velikost. Jedna věta může mít více platných segmentací a algoritmus vybere nejpravděpodobnější nebo vzorkuje alternativy. Nejde o klasický n-gram model dalšího slova. Tokenizačný model se verzuje spolu s normalizací a slovníkem, protože změna segmentace mění všechny vstupy neuronové sítě.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-12

Odborná definice

Odborná definice

Unigram language model v tokenizaci předpokládá, že text vzniká postupností subword jednotek, z kterých každá má vlastní pravděpodobnost nezávislou od sousedů. Trénink začíná velkým kandidátskym slovníkem a opakovaně odstraňuje jednotky s malým přínosem k pravděpodobnosti korpusu, zatímco nedosiahne cílovou velikost. Jedna věta může mít více platných segmentací a algoritmus vybere nejpravděpodobnější nebo vzorkuje alternativy. Nejde o klasický n-gram model dalšího slova. Tokenizačný model se verzuje spolu s normalizací a slovníkem, protože změna segmentace mění všechny vstupy neuronové sítě.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Slovo může být rozdělené na celé slovo, koreň a príponu nebo na kratšie kúsky. Unigramový tokenizér má seznam možných kúsků a při každém pravděpodobnost. Pro celou větu hledá kombinaci, která má nejvyšší společné skóre. Během tréninku postupně vyhadzuje jednotky, bez kterých se korpus dá stále dobře vysvetlit. Výhodou je pružná segmentace a možnost samplingom vytvářet více variant, co může zvýšit robustnost modelu vůči pravopisu a morfológii. Při migraci se musí prepočítat sekvence, embeddingy i dlžkové limity, nestačí vymenit jeden soubor tokenizéra.

Časté otázky

Časté otázky

Jak se unigram tokenizace liší od BPE?

BPE deterministicky spojuje často susediace symboly podle naučených merge pravidel. Unigram začíná množinou kandidátů a optimalizuje pravděpodobnostní slovník segmentů.

Proč může mít věta více segmentací?

Stejný řetězec lze poskladat z různých subword jednotek. Model přiřadí každé možnosti pravděpodobnost a dekóder zvolí najlepšiu nebo vzorek.

Co je subword regularization?

Během tréninku jazykového modelu se náhodně vzorkují alternatívne segmentace. Model tak není viazaný na jediný rozklad a může lépe zvládat vzácně tvary.

Jak se určí velikost slovníka?

Je to hyperparameter tokenizéra. Menší slovník predlžuje sekvence, větší zvyšuje embeddingovou matici a může vytvářet málo používané jednotky.

Je unigram model vhodný pro slovenčinu?

Může dobře zachytit morfologické části, ale výsledek závisí na korpusu, normalizace a character coverage. Kvalita se hodnotí i na menách, skratkách a diakritike.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates SentencePiece repository and documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.