Spracovanie prirodzeného jazyka

BERT

Bidirectional Encoder Representations from Transformers

BERT je rodina encoderových transformerových modelov predtrénovaných na obojsmerné reprezentácie textu. Pôvodný model používa masked language modeling, pri ktorom predikuje zakryté tokeny z ľavého aj pravého kontextu, a v pôvodnej verzii aj úlohu next sentence prediction. Po predtrénovaní sa model jemne dolaďuje alebo používa ako encoder pre klasifikáciu, extrakciu entít, otázky a odpovede či vyhľadávanie. BERT nie je autoregresívny generátor textu v štýle decoderových LLM, hoci jeho reprezentácie možno zapojiť do generatívnych systémov.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-B-14

Odborná definícia

Odborná definícia

BERT je rodina encoderových transformerových modelov predtrénovaných na obojsmerné reprezentácie textu. Pôvodný model používa masked language modeling, pri ktorom predikuje zakryté tokeny z ľavého aj pravého kontextu, a v pôvodnej verzii aj úlohu next sentence prediction. Po predtrénovaní sa model jemne dolaďuje alebo používa ako encoder pre klasifikáciu, extrakciu entít, otázky a odpovede či vyhľadávanie. BERT nie je autoregresívny generátor textu v štýle decoderových LLM, hoci jeho reprezentácie možno zapojiť do generatívnych systémov.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Vo vete „Banka schválila úver po kontrole...“ môže význam zakrytého slova závisieť od textu pred ním aj za ním. BERT pri učení vidí obe strany a vytvára kontextovú reprezentáciu každého tokenu. Tá sa potom dá prispôsobiť úlohe, napríklad rozpoznaniu mena firmy alebo určeniu sentimentu. Model nevytvára odpoveď token po tokene ako chatovací decoder. Skôr text prečíta, prepojí informácie v celej dostupnej sekvencii a poskytne vektory, z ktorých ďalšia vrstva odvodí klasifikáciu alebo extrakciu.

Časté otázky

Časté otázky

Prečo sa BERT nazýva obojsmerný?

Pri masked language modeling využíva pri reprezentácii tokenu kontext naľavo aj napravo. Nejde iba o spojenie dvoch oddelených jednosmerných sietí, attention vrstvy môžu podmienene prepájať pozície v celej vstupnej sekvencii.

Čo je token [CLS]?

V klasickom BERT vstupe sa pridáva špeciálny token na začiatok sekvencie. Jeho finálna reprezentácia sa často používa ako súhrnný vstup pre klasifikačnú hlavu. Nie je však zaručené, že je najlepšou reprezentáciou pre každú úlohu.

Na čo slúži token [MASK]?

Počas predtrénovania nahrádza časť tokenov a model sa učí obnoviť ich identitu z kontextu. Pri bežnom fine-tuningu sa [MASK] väčšinou nepoužíva, čo vytvára rozdiel medzi predtrénovacím a aplikačným režimom.

Aký je rozdiel medzi BERT a GPT?

BERT je primárne encoder, ktorý spracúva dostupnú sekvenciu obojsmerne a hodí sa na porozumenie textu. GPT typicky používa kauzálny decoder a predikuje ďalší token, preto prirodzene generuje pokračovanie. Moderné systémy môžu kombinovať oba princípy.

Je BERT vhodný pre slovenčinu?

Áno, ak model obsahuje vhodné slovenské dáta a tokenizér. Multilingválne verzie poskytujú základ, no kvalita závisí od zastúpenia jazyka a domény. Pre odborné texty môže pomôcť doménové predtrénovanie alebo fine-tuning na slovenskom datasete.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Devlin a kol., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.