Odborná definice
Odborná definice
Bidirectional model vytváří reprezentaci prvku sekvence s využitím kontextu z obou smerů. V klasických bidirectional RNN se kombinuje síť čítajúca sekvenci dopredu se sítí čítajúcou ji zpětně. V encoderových transformerech umožňuje neobmedzená self-attention pozici pracovat s tokenmi před ňou i za ňou. Takový model je vhodný na porozumění kompletne dostupného vstupu, například klasifikaci nebo označování tokenů. Není přímo vhodný na kauzální generování budoucích tokenů, protože by během tréninku mohl vidět informaci, která při generování ještě neexistuje.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Při určování významu slova „zámok“ pomáhá vědět, či později nasleduje „na dverách“ nebo „při rieke“. Obousměrný model zpracuje celou větu a při reprezentaci slova využije předchozí i nasledujúce části. To je výhoda při extrakcii entít, sentimentovej analýze nebo doplňaní maskovaného slova. Při generování věty však budoucí tokeny ještě nepoznáme. Autoregresivní model proto používá kauzálnu masku a vidí pouze minulost. Obojsmernost tedy není obecně lepší, je prispůsobená jinému typu úlohy.
Časté otázky
Časté otázky
Je BERT bidirectional model?
Ano. Jeho encoder při masked language modeling vytváří reprezentace s přístupem k lavému i pravému kontextu. Slovo bidirectional v názve zdůrazňuje právě tento způsob kondicionování reprezentací.
Může obousměrný model generovat text?
Může být součástí generativního systému, ale klasické token-by-token generování vyžaduje mechanismus, který nevidí budúcnost. Encoder se často kombinuje s kauzálnym decoderom, jako v encoder-decoder transformerech.
Co je bidirectional LSTM?
Dvě LSTM spracují stejnou sekvenci opačnými smermi a jejich hidden states se spoja. Výstup při každé pozici nese informaci z minulého i budúceho kontextu. Nevýhodou je nemožnost čisto streamového zpracování bez zpoždění.
Proč obojsmernost způsobuje data leakage při predikci času?
Pokud má model predikovat budúcnost, vstup z neskoršieho času nesmí ovlivnit reprezentaci skoršieho bodu. Neopatrné použití obojsmernej vrstvy může poskytnout modelu budoucí pozorování a vytvořit nereálne validační skóre.
Kdy je jednosmerný model vhodnější?
Při streamingu, online rozpoznávání, forecastingu a autoregresivním generování, kde budúci kontext není dostupný. Jednosmerná architektura odpovídá informačným obmedzeniam reálného nasazení.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Devlin a kol., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
