Generatívna a jazyková AI · Viacjazyčné reprezentácie textu

XLM-RoBERTa viacjazyčný encoder

XLM-R

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-X-15

Odborná definícia

Význam a odborné vymedzenie pojmu

XLM-R, celým názvom XLM-RoBERTa, je transformerový encoder predtrénovaný masked language modelingom na filtrovaných CommonCrawl dátach v sto jazykoch. Nepoužíva paralelné vety ani translation language modeling ako pôvodný XLM. Zdieľaný SentencePiece slovník a spoločná kapacita umožňujú cross-lingual transfer, ale vytvárajú kompromis medzi pozitívnym prenosom a capacity dilution. Model je určený najmä na porozumenie textu, klasifikáciu, NER alebo extrakciu po fine-tuningu. Nie je autoregresívnym generátorom a jeho výsledky sa medzi jazykmi výrazne líšia.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

XLM-R číta text z mnohých jazykov a učí sa dopĺňať skryté časti viet. Všetky jazyky používajú jeden model a spoločný slovník subwordov, takže podobné významy môžu zdieľať reprezentácie. To pomáha preniesť označenia z bohato pokrytého jazyka do slabšieho. Kapacita je však spoločná, preto veľké jazyky môžu spotrebovať väčšiu časť modelu a niektoré malé jazyky zostanú rozdelené na neprakticky veľa tokenov. Výsledok treba merať samostatne pre každý jazyk. Pri právnom alebo medicínskom texte treba navyše overiť odbornú terminológiu, nie iba všeobecný jazykový benchmark.

Časté otázky

Otázky, ktoré spresňujú význam

Koľko jazykov zahŕňal pôvodný XLM-R?

Pôvodná práca uvádza sto jazykov a viac než dva terabajty filtrovaných CommonCrawl dát. Konkrétne checkpointy môžu mať rovnaký tréningový základ, ale inú veľkosť.

Je XLM-R vhodný na generovanie textu?

Nie je navrhnutý ako decoder generujúci ďalší token. Je to encoder, ktorý vytvára kontextové reprezentácie pre klasifikáciu a extrakčné úlohy.

Čo znamená capacity dilution?

Pevný počet parametrov musí reprezentovať viac jazykov. Po pridaní jazykov môže každý získať menší podiel kapacity, hoci zároveň profituje z prenosu.

Ako sa používa na slovenské NER?

Na tokenizované slovenské dáta s entitnými štítkami sa pridá klasifikačná hlava a model sa dolaďuje. Hodnotí sa entity-level F1 a chyby tokenizácie.

Prečo nestačí uviesť priemerné multilingual skóre?

Priemer môže zakryť výrazne slabšie jazyky alebo písma. Produkčný audit potrebuje výsledky po jazykoch, doménach a dĺžkach vstupu.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Unsupervised Cross-lingual Representation Learning at Scale
  • Hugging Face, XLM-RoBERTa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.