Odborná definice
Odborná definice
XLM označuje rodinu metod cross-lingual language model pretraining, které učí společné reprezentace více jazyků. Původná práca predstavila monolingválny masked language modeling a supervised translation language modeling nad paralelnými vetami. Cílem je prenášat znalosti mezi jazykmi při klasifikaci, porozumení a preklade. Skratka XLM není všeobecným označením každého viacjazyčného modelu a nemá se zamieňat s XLM-R. Výkon závisí na jazykového pokrytí, tokenizace, vyvážení korpusu a dostupnosti paralelných dat.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Pokud se model učí slovenčinu, francúzštinu a arabčinu zcela odděleně, nemůže jednoduše přenést společné významy. XLM vytváří prostor, ve kterém se podobné věty z různých jazyků približují. Při supervised cílí vidí i paralelní preklady a učí se prepájat jejich tokeny a kontext. Potom lze model natrénovat na označených příkladech v jednom jazyku a část schopnosti přenést do dalšího. Kvalita přenosu však klesá při slabo zastúpenom jazyku nebo odlišnom písme. Při nasazení se zvlášť testují jména, morfológia a jazyky, které mají v tréninku málo textu.
Časté otázky
Časté otázky
Jaký je rozdíl mezi MLM a TLM v XLM?
MLM maskuje tokeny v monolingválnom textu. TLM spojuje paralelní věty do jednoho vstupu a umožňuje, aby model při rekonštrukcii využíval kontext z obou jazyků.
Je XLM generativní prekladový systém?
Rodina zahrňala predtréning použitelný i pro překlad, ale název sám neznamená hotový produkční prekladač. Potřebná je architektura a fine-tuning pro konkrétní úlohu.
Co je zero-shot cross-lingual transfer?
Model se dolaďuje na označených datech jednoho jazyka a vyhodnotí se v jiném jazyku bez jeho úlohových štítků. Úspěch závisí na zarovnání reprezentací.
Proč tokenizace ovlivňuje nízkozdrojové jazyky?
Jazyk s malým podielom tréninkových dat může být rozdělený na dlouhé sekvence vzácných subwordů. To zvyšuje výpočty a oslabuje reprezentaci slovních vzorů.
Je XLM-R novšia verze stejného tréninkového cíle?
XLM-R používá velký masked language model nad Commoncrawl daty bez TLM cíle. Jde o príbuznou, ale samostatně navrhnutou rodinu.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Cross-lingual Language Model Pretraining XLM Repository
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
