Predtrénovanie jazykových modelov

Masked language modeling

Maskované jazykové modelovanie

Masked language modeling, MLM, je tréningový cieľ, pri ktorom sa časť tokenov vo vstupnej sekvencii skryje, nahradí alebo naruší a model má rekonštruovať ich pôvodnú identitu z okolitého kontextu. Cieľ umožňuje bidirekcionálnemu encoderu využívať informáciu zľava aj sprava. Klasickým príkladom je BERT, ktorý kombinuje maskovanie s pravidlami nahradenia tokenov. Rozdelenie masiek, percento poškodených tokenov a spôsob dynamického maskovania ovplyvňujú, aké reprezentácie sa model naučí.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-M-06

Odborná definícia

Odborná definícia

Masked language modeling, MLM, je tréningový cieľ, pri ktorom sa časť tokenov vo vstupnej sekvencii skryje, nahradí alebo naruší a model má rekonštruovať ich pôvodnú identitu z okolitého kontextu. Cieľ umožňuje bidirekcionálnemu encoderu využívať informáciu zľava aj sprava. Klasickým príkladom je BERT, ktorý kombinuje maskovanie s pravidlami nahradenia tokenov. Rozdelenie masiek, percento poškodených tokenov a spôsob dynamického maskovania ovplyvňujú, aké reprezentácie sa model naučí.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Veta sa modelu ukáže s vynechaným slovom, napríklad: Lekár predpísal pacientovi [MASK]. Model má z ostatných slov odhadnúť, čo na mieste chýba. Pri miliónoch takýchto úloh sa naučí vzťahy medzi slovami, syntaxou a významom bez ručne vytvorených štítkov. Výsledkom nie je bežný generátor pokračovania textu, pretože model vidí kontext na oboch stranách medzery. Predtrénovaný encoder sa potom môže doladiť na klasifikáciu, extrakciu entít, vyhľadávanie alebo odpovedanie na otázky.

Časté otázky

Časté otázky

Prečo sa nemaskuje každý token?

Model potrebuje dostatok viditeľného kontextu, aby rekonštrukcia mala zmysel. Príliš veľa masiek by zmenilo úlohu na hádanie z nedostatočnej informácie.

Čo je dynamické maskovanie?

Maskované pozície sa pri rôznych prechodoch dátami menia. Rovnaká veta tak poskytne viac tréningových kombinácií a model si nezapamätá jednu pevnú masku.

Je MLM autoregresívne modelovanie?

Nie. Autoregresívny model predikuje ďalší token z predchádzajúcich tokenov. MLM rekonštruuje skryté pozície s využitím kontextu z oboch strán.

Prečo BERT niekedy nahradí maskovaný token náhodným slovom?

Tým znižuje rozdiel medzi predtrénovaním a neskorším použitím, kde špeciálny token MASK zvyčajne nie je prítomný, a núti model rozpoznať poškodený kontext.

Na čo sa používajú MLM reprezentácie?

Najmä na úlohy porozumenia textu, tokenovú klasifikáciu, vyhľadávanie a extrakciu. Pre voľné generovanie dlhého textu sa častejšie používajú autoregresívne modely.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Devlin et al., BERT

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.