Vícejazyčné reprezentace textu

XLM-Roberta vícejazyčný encoder

XLM-R, celým názvem XLM-Roberta, je transformerový encoder předtrénovaný masked language modelingom na filtrovaných Commoncrawl datech v sto jazycích. Nepoužívá paralelní věty ani translation language modeling jako původní XLM. Zdielaný Sentencepiece slovník a společná kapacita umožňují cross-lingual transfer, ale vytvářejí kompromis mezi pozitívnym prenosom a capacity dilution. Model je určený zejména na porozumění textu, klasifikaci, NER nebo extrakci po fine-tuningu. Není autoregresívnym generátorom a jeho výsledky se mezi jazykmi výrazně liší.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-X-15

Odborná definice

Odborná definice

XLM-R, celým názvem XLM-Roberta, je transformerový encoder předtrénovaný masked language modelingom na filtrovaných Commoncrawl datech v sto jazycích. Nepoužívá paralelní věty ani translation language modeling jako původní XLM. Zdielaný Sentencepiece slovník a společná kapacita umožňují cross-lingual transfer, ale vytvářejí kompromis mezi pozitívnym prenosom a capacity dilution. Model je určený zejména na porozumění textu, klasifikaci, NER nebo extrakci po fine-tuningu. Není autoregresívnym generátorom a jeho výsledky se mezi jazykmi výrazně liší.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

XLM-R čte text z mnoha jazyků a učí se doplňat skryté části vět. Všechny jazyky používají jeden model a společný slovník subwordů, takže podobné významy mohou zdielat reprezentace. To pomáhá přenést označení z bohato pokrytého jazyka do slabšieho. Kapacita je však společná, proto velké jazyky mohou spotrebovat větší část modelu a některé malé jazyky zůstanou rozdělené na neprakticky mnoho tokenů. Výsledek je třeba měřit samostatně pro každý jazyk. Při právním nebo medicínském textu je třeba navíc ověřit odbornou terminologii, ne pouze obecný jazykový benchmark.

Časté otázky

Časté otázky

Kolik jazyků zahrňal původní XLM-R?

Původná práca uvádí sto jazyků a více než dva terabajty filtrovaných Commoncrawl dat. Konkrétně checkpointy mohou mít stejný tréninkový základ, ale jinou velikost.

Je XLM-R vhodný na generování textu?

Není navržený jako decoder generujúci další token. Je to encoder, který vytváří kontextové reprezentace pro klasifikaci a extrakčné úlohy.

Co znamená capacity dilution?

Pevný počet parametrů musí reprezentovat více jazyků. Po pridaní jazyků může každý získat menší podíl kapacity, ačkoli zároveň profituje z přenosu.

Jak se používá na slovenské NER?

Na tokenizované slovenské data s entitnými štítkami se přidá klasifikační hlava a model se dolaďuje. Hodnotí se entity-level F1 a chyby tokenizace.

Proč nestačí uvést průměrné multilingual skóre?

Průměr může zakrýt výrazně slabšie jazyky nebo písma. Produkční audit potřebuje výsledky po jazycích, doménach a dlžkach vstupu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Unsupervised Cross-lingual Representation Learning at Scale
  • Hugging Face, XLM-RoBERTa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.