Odborná definice
Odborná definice
BERT je rodina encoderových transformerových modelů predtrénovaných na obojsmerné reprezentace textu. Původní model používá masked language modeling, při kterém predikuje zakryté tokeny z lavého i pravého kontextu, a v původní verzi i úlohu next sentence prediction. Po předtrénování se model jemne dolaďuje nebo používá jako encoder pro klasifikaci, extrakci entít, otázky a odpovědi či vyhledávání. BERT není autoregresivní generátor textu v štýle decoderových LLM, ačkoli jeho reprezentace lze zapojit do generativních systémů.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Ve vete „Banka schválila úver po kontrole...“ může význam zakrytého slova záviset od textu před ním i za ním. BERT při učení vidí obě strany a vytváří kontextovou reprezentaci každého tokenu. Tá se potom dá přizpůsobit úloze, například rozpoznání mena firmy nebo určení sentimentu. Model nevytváří odpověď token po tokene jako chatovací decoder. Dříve text prečíta, prepojí informace v celé dostupnej sekvenci a poskytne vektory, z kterých další vrstva odvodí klasifikaci nebo extrakci.
Časté otázky
Časté otázky
Proč se BERT nazýva obousměrný?
Při masked language modeling využívá při reprezentaci tokenu kontext nalavo i napravo. Nejde pouze o spojení dvou oddelených jednosmerných sítí, attention vrstvy mohou podmienene prepájat pozice v celé vstupní sekvenci.
Co je token [CLS]?
V klasickém BERT vstupe se přidává špeciálny token na začiatok sekvence. Jeho finálna reprezentace se často používá jako súhrnný vstup pro klasifikační hlavu. Není však zaručené, že je najlepšou reprezentací pro každou úlohu.
Na co slouží token [MASK]?
Během předtrénování nahrazuje část tokenů a model se učí obnovit jejich identitu z kontextu. Při běžném fine-tuningu se [MASK] večšinou nepoužívá, co vytváří rozdíl mezi predtrénovacím a aplikačným režimom.
Jaký je rozdíl mezi BERT a GPT?
BERT je primárně encoder, který zpracovává dostupnou sekvenci obojsmerne a hodí se na porozumění textu. GPT typicky používá kauzální decoder a predikuje další token, proto přirozeně generuje pokračování. Moderní systémy mohou kombinovat oba princípy.
Je BERT vhodný pro slovenčinu?
Ano, pokud model obsahuje vhodné slovenské data a tokenizér. Multilingválne verze poskytují základ, ale kvalita závisí na zastoupení jazyka a domény. Pro odborné texty může pomoci doménové předtrénování nebo fine-tuning na slovenskom datasete.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Devlin a kol., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
