Vícejazyčné jazykové modely

XLM

XLM označuje rodinu metod cross-lingual language model pretraining, které učí společné reprezentace více jazyků. Původná práca predstavila monolingválny masked language modeling a supervised translation language modeling nad paralelnými vetami. Cílem je prenášat znalosti mezi jazykmi při klasifikaci, porozumení a preklade. Skratka XLM není všeobecným označením každého viacjazyčného modelu a nemá se zamieňat s XLM-R. Výkon závisí na jazykového pokrytí, tokenizace, vyvážení korpusu a dostupnosti paralelných dat.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-X-14

Odborná definice

Odborná definice

XLM označuje rodinu metod cross-lingual language model pretraining, které učí společné reprezentace více jazyků. Původná práca predstavila monolingválny masked language modeling a supervised translation language modeling nad paralelnými vetami. Cílem je prenášat znalosti mezi jazykmi při klasifikaci, porozumení a preklade. Skratka XLM není všeobecným označením každého viacjazyčného modelu a nemá se zamieňat s XLM-R. Výkon závisí na jazykového pokrytí, tokenizace, vyvážení korpusu a dostupnosti paralelných dat.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud se model učí slovenčinu, francúzštinu a arabčinu zcela odděleně, nemůže jednoduše přenést společné významy. XLM vytváří prostor, ve kterém se podobné věty z různých jazyků približují. Při supervised cílí vidí i paralelní preklady a učí se prepájat jejich tokeny a kontext. Potom lze model natrénovat na označených příkladech v jednom jazyku a část schopnosti přenést do dalšího. Kvalita přenosu však klesá při slabo zastúpenom jazyku nebo odlišnom písme. Při nasazení se zvlášť testují jména, morfológia a jazyky, které mají v tréninku málo textu.

Časté otázky

Časté otázky

Jaký je rozdíl mezi MLM a TLM v XLM?

MLM maskuje tokeny v monolingválnom textu. TLM spojuje paralelní věty do jednoho vstupu a umožňuje, aby model při rekonštrukcii využíval kontext z obou jazyků.

Je XLM generativní prekladový systém?

Rodina zahrňala predtréning použitelný i pro překlad, ale název sám neznamená hotový produkční prekladač. Potřebná je architektura a fine-tuning pro konkrétní úlohu.

Co je zero-shot cross-lingual transfer?

Model se dolaďuje na označených datech jednoho jazyka a vyhodnotí se v jiném jazyku bez jeho úlohových štítků. Úspěch závisí na zarovnání reprezentací.

Proč tokenizace ovlivňuje nízkozdrojové jazyky?

Jazyk s malým podielom tréninkových dat může být rozdělený na dlouhé sekvence vzácných subwordů. To zvyšuje výpočty a oslabuje reprezentaci slovních vzorů.

Je XLM-R novšia verze stejného tréninkového cíle?

XLM-R používá velký masked language model nad Commoncrawl daty bez TLM cíle. Jde o príbuznou, ale samostatně navrhnutou rodinu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Cross-lingual Language Model Pretraining XLM Repository

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.