Odborná definícia
Význam a odborné vymedzenie pojmu
XLM-R, celým názvom XLM-RoBERTa, je transformerový encoder predtrénovaný masked language modelingom na filtrovaných CommonCrawl dátach v sto jazykoch. Nepoužíva paralelné vety ani translation language modeling ako pôvodný XLM. Zdieľaný SentencePiece slovník a spoločná kapacita umožňujú cross-lingual transfer, ale vytvárajú kompromis medzi pozitívnym prenosom a capacity dilution. Model je určený najmä na porozumenie textu, klasifikáciu, NER alebo extrakciu po fine-tuningu. Nie je autoregresívnym generátorom a jeho výsledky sa medzi jazykmi výrazne líšia.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
XLM-R číta text z mnohých jazykov a učí sa dopĺňať skryté časti viet. Všetky jazyky používajú jeden model a spoločný slovník subwordov, takže podobné významy môžu zdieľať reprezentácie. To pomáha preniesť označenia z bohato pokrytého jazyka do slabšieho. Kapacita je však spoločná, preto veľké jazyky môžu spotrebovať väčšiu časť modelu a niektoré malé jazyky zostanú rozdelené na neprakticky veľa tokenov. Výsledok treba merať samostatne pre každý jazyk. Pri právnom alebo medicínskom texte treba navyše overiť odbornú terminológiu, nie iba všeobecný jazykový benchmark.
Časté otázky
Otázky, ktoré spresňujú význam
Koľko jazykov zahŕňal pôvodný XLM-R?
Pôvodná práca uvádza sto jazykov a viac než dva terabajty filtrovaných CommonCrawl dát. Konkrétne checkpointy môžu mať rovnaký tréningový základ, ale inú veľkosť.
Je XLM-R vhodný na generovanie textu?
Nie je navrhnutý ako decoder generujúci ďalší token. Je to encoder, ktorý vytvára kontextové reprezentácie pre klasifikáciu a extrakčné úlohy.
Čo znamená capacity dilution?
Pevný počet parametrov musí reprezentovať viac jazykov. Po pridaní jazykov môže každý získať menší podiel kapacity, hoci zároveň profituje z prenosu.
Ako sa používa na slovenské NER?
Na tokenizované slovenské dáta s entitnými štítkami sa pridá klasifikačná hlava a model sa dolaďuje. Hodnotí sa entity-level F1 a chyby tokenizácie.
Prečo nestačí uviesť priemerné multilingual skóre?
Priemer môže zakryť výrazne slabšie jazyky alebo písma. Produkčný audit potrebuje výsledky po jazykoch, doménach a dĺžkach vstupu.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Unsupervised Cross-lingual Representation Learning at Scale
- Hugging Face, XLM-RoBERTa
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
