Zpracování přirozeného jazyka

BERT

BERT je rodina encoderových transformerových modelů predtrénovaných na obojsmerné reprezentace textu. Původní model používá masked language modeling, při kterém predikuje zakryté tokeny z lavého i pravého kontextu, a v původní verzi i úlohu next sentence prediction. Po předtrénování se model jemne dolaďuje nebo používá jako encoder pro klasifikaci, extrakci entít, otázky a odpovědi či vyhledávání. BERT není autoregresivní generátor textu v štýle decoderových LLM, ačkoli jeho reprezentace lze zapojit do generativních systémů.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-B-14

Odborná definice

Odborná definice

BERT je rodina encoderových transformerových modelů predtrénovaných na obojsmerné reprezentace textu. Původní model používá masked language modeling, při kterém predikuje zakryté tokeny z lavého i pravého kontextu, a v původní verzi i úlohu next sentence prediction. Po předtrénování se model jemne dolaďuje nebo používá jako encoder pro klasifikaci, extrakci entít, otázky a odpovědi či vyhledávání. BERT není autoregresivní generátor textu v štýle decoderových LLM, ačkoli jeho reprezentace lze zapojit do generativních systémů.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Ve vete „Banka schválila úver po kontrole...“ může význam zakrytého slova záviset od textu před ním i za ním. BERT při učení vidí obě strany a vytváří kontextovou reprezentaci každého tokenu. Tá se potom dá přizpůsobit úloze, například rozpoznání mena firmy nebo určení sentimentu. Model nevytváří odpověď token po tokene jako chatovací decoder. Dříve text prečíta, prepojí informace v celé dostupnej sekvenci a poskytne vektory, z kterých další vrstva odvodí klasifikaci nebo extrakci.

Časté otázky

Časté otázky

Proč se BERT nazýva obousměrný?

Při masked language modeling využívá při reprezentaci tokenu kontext nalavo i napravo. Nejde pouze o spojení dvou oddelených jednosmerných sítí, attention vrstvy mohou podmienene prepájat pozice v celé vstupní sekvenci.

Co je token [CLS]?

V klasickém BERT vstupe se přidává špeciálny token na začiatok sekvence. Jeho finálna reprezentace se často používá jako súhrnný vstup pro klasifikační hlavu. Není však zaručené, že je najlepšou reprezentací pro každou úlohu.

Na co slouží token [MASK]?

Během předtrénování nahrazuje část tokenů a model se učí obnovit jejich identitu z kontextu. Při běžném fine-tuningu se [MASK] večšinou nepoužívá, co vytváří rozdíl mezi predtrénovacím a aplikačným režimom.

Jaký je rozdíl mezi BERT a GPT?

BERT je primárně encoder, který zpracovává dostupnou sekvenci obojsmerne a hodí se na porozumění textu. GPT typicky používá kauzální decoder a predikuje další token, proto přirozeně generuje pokračování. Moderní systémy mohou kombinovat oba princípy.

Je BERT vhodný pro slovenčinu?

Ano, pokud model obsahuje vhodné slovenské data a tokenizér. Multilingválne verze poskytují základ, ale kvalita závisí na zastoupení jazyka a domény. Pro odborné texty může pomoci doménové předtrénování nebo fine-tuning na slovenskom datasete.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Devlin a kol., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.