Odborná definícia
Odborná definícia
Unigram language model v tokenizácii predpokladá, že text vzniká postupnosťou subword jednotiek, z ktorých každá má vlastnú pravdepodobnosť nezávislú od susedov. Tréning začína veľkým kandidátskym slovníkom a opakovane odstraňuje jednotky s malým prínosom k pravdepodobnosti korpusu, kým nedosiahne cieľovú veľkosť. Jedna veta môže mať viac platných segmentácií a algoritmus vyberie najpravdepodobnejšiu alebo vzorkuje alternatívy. Nejde o klasický n-gram model ďalšieho slova. Tokenizačný model sa verzuje spolu s normalizáciou a slovníkom, pretože zmena segmentácie mení všetky vstupy neurónovej siete.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Slovo môže byť rozdelené na celé slovo, koreň a príponu alebo na kratšie kúsky. Unigramový tokenizér má zoznam možných kúskov a pri každom pravdepodobnosť. Pre celú vetu hľadá kombináciu, ktorá má najvyššie spoločné skóre. Počas tréningu postupne vyhadzuje jednotky, bez ktorých sa korpus dá stále dobre vysvetliť. Výhodou je pružná segmentácia a možnosť samplingom vytvárať viac variantov, čo môže zvýšiť robustnosť modelu voči pravopisu a morfológii. Pri migrácii sa musia prepočítať sekvencie, embeddingy aj dĺžkové limity, nestačí vymeniť jeden súbor tokenizéra.
Časté otázky
Časté otázky
Ako sa unigram tokenizácia líši od BPE?
BPE deterministicky spája často susediace symboly podľa naučených merge pravidiel. Unigram začína množinou kandidátov a optimalizuje pravdepodobnostný slovník segmentov.
Prečo môže mať veta viac segmentácií?
Rovnaký reťazec možno poskladať z rôznych subword jednotiek. Model priradí každej možnosti pravdepodobnosť a dekóder zvolí najlepšiu alebo vzorku.
Čo je subword regularization?
Počas tréningu jazykového modelu sa náhodne vzorkujú alternatívne segmentácie. Model tak nie je viazaný na jediný rozklad a môže lepšie zvládať vzácne tvary.
Ako sa určí veľkosť slovníka?
Je to hyperparameter tokenizéra. Menší slovník predlžuje sekvencie, väčší zvyšuje embeddingovú maticu a môže vytvárať málo používané jednotky.
Je unigram model vhodný pre slovenčinu?
Môže dobre zachytiť morfologické časti, no výsledok závisí od korpusu, normalizácie a character coverage. Kvalita sa hodnotí aj na menách, skratkách a diakritike.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates SentencePiece repository and documentation
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
