Odborná definícia
Význam a odborné vymedzenie pojmu
Unigram language model v tokenizácii predpokladá, že text vzniká postupnosťou subword jednotiek, z ktorých každá má vlastnú pravdepodobnosť nezávislú od susedov. Tréning začína veľkým kandidátskym slovníkom a opakovane odstraňuje jednotky s malým prínosom k pravdepodobnosti korpusu, kým nedosiahne cieľovú veľkosť. Jedna veta môže mať viac platných segmentácií a algoritmus vyberie najpravdepodobnejšiu alebo vzorkuje alternatívy. Nejde o klasický n-gram model ďalšieho slova. Tokenizačný model sa verzuje spolu s normalizáciou a slovníkom, pretože zmena segmentácie mení všetky vstupy neurónovej siete.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Slovo môže byť rozdelené na celé slovo, koreň a príponu alebo na kratšie kúsky. Unigramový tokenizér má zoznam možných kúskov a pri každom pravdepodobnosť. Pre celú vetu hľadá kombináciu, ktorá má najvyššie spoločné skóre. Počas tréningu postupne vyhadzuje jednotky, bez ktorých sa korpus dá stále dobre vysvetliť. Výhodou je pružná segmentácia a možnosť samplingom vytvárať viac variantov, čo môže zvýšiť robustnosť modelu voči pravopisu a morfológii. Pri migrácii sa musia prepočítať sekvencie, embeddingy aj dĺžkové limity, nestačí vymeniť jeden súbor tokenizéra.
Časté otázky
Otázky, ktoré spresňujú význam
Ako sa unigram tokenizácia líši od BPE?
BPE deterministicky spája často susediace symboly podľa naučených merge pravidiel. Unigram začína množinou kandidátov a optimalizuje pravdepodobnostný slovník segmentov.
Prečo môže mať veta viac segmentácií?
Rovnaký reťazec možno poskladať z rôznych subword jednotiek. Model priradí každej možnosti pravdepodobnosť a dekóder zvolí najlepšiu alebo vzorku.
Čo je subword regularization?
Počas tréningu jazykového modelu sa náhodne vzorkujú alternatívne segmentácie. Model tak nie je viazaný na jediný rozklad a môže lepšie zvládať vzácne tvary.
Ako sa určí veľkosť slovníka?
Je to hyperparameter tokenizéra. Menší slovník predlžuje sekvencie, väčší zvyšuje embeddingovú maticu a môže vytvárať málo používané jednotky.
Je unigram model vhodný pre slovenčinu?
Môže dobre zachytiť morfologické časti, no výsledok závisí od korpusu, normalizácie a character coverage. Kvalita sa hodnotí aj na menách, skratkách a diakritike.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates SentencePiece repository and documentation
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
