Předtrénování jazykových modelů

Maskované jazykové modelování

Masked language modeling, MLM, je tréninkový cíl, při kterém se část tokenů ve vstupní sekvenci skryje, nahradí nebo naruší a model má rekonštruovat jejich původní identitu z okolitého kontextu. Cíl umožňuje bidirekcionálnemu encoderu využívat informaci zlava i sprava. Klasickým příkladem je BERT, který kombinuje maskování s pravidly nahradení tokenů. Rozdělení masiek, percento poškodených tokenů a způsob dynamického maskování ovlivňují, jaké reprezentace se model naučí.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-M-06

Odborná definice

Odborná definice

Masked language modeling, MLM, je tréninkový cíl, při kterém se část tokenů ve vstupní sekvenci skryje, nahradí nebo naruší a model má rekonštruovat jejich původní identitu z okolitého kontextu. Cíl umožňuje bidirekcionálnemu encoderu využívat informaci zlava i sprava. Klasickým příkladem je BERT, který kombinuje maskování s pravidly nahradení tokenů. Rozdělení masiek, percento poškodených tokenů a způsob dynamického maskování ovlivňují, jaké reprezentace se model naučí.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Věta se modelu ukáže s vynechaným slovem, například: Lekár predpísal pacientovi [MASK]. Model má z ostatních slov odhadnout, co na mieste chybí. Při miliónoch takýchto úloh se naučí vztahy mezi slovami, syntaxou a významom bez ručně vytvorených štítků. Výsledkem není běžný generátor pokračování textu, protože model vidí kontext na obou stranách medzery. Předtrénovaný encoder se potom může doladit na klasifikaci, extrakci entít, vyhledávání nebo odpovídání na otázky.

Časté otázky

Časté otázky

Proč se nemaskuje každý token?

Model potřebuje dostatek viditelného kontextu, aby rekonštrukce mala smysl. Příliš mnoho masiek by zmenilo úlohu na hádání z nedostatočnej informace.

Co je dynamické maskování?

Maskované pozice se při různých prechodoch daty mění. Stejná věta tak poskytne více tréninkových kombinací a model si nezapametá jednu pevnou masku.

Je MLM autoregresívne modelování?

Ne. Autoregresivní model predikuje další token z předchozích tokenů. MLM rekonštruuje skryté pozice s využitím kontextu z obou strán.

Proč BERT někdy nahradí maskovaný token náhodným slovem?

Tím snižuje rozdíl mezi predtrénováním a neskorším použitím, kde špeciálny token MASK obvykle není prítomný, a núti model rozpoznat poškodený kontext.

Na co se používají MLM reprezentace?

Zejména na úlohy porozumění textu, tokenovou klasifikaci, vyhledávání a extrakci. Pro volné generování dlhého textu se častěji používají autoregresívne modely.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Devlin et al., BERT

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.