Modelovanie sekvencií

Bidirectional model

Obojsmerný model

Bidirectional model vytvára reprezentáciu prvku sekvencie s využitím kontextu z oboch smerov. V klasických bidirectional RNN sa kombinuje sieť čítajúca sekvenciu dopredu so sieťou čítajúcou ju odzadu. V encoderových transformeroch umožňuje neobmedzená self-attention pozícii pracovať s tokenmi pred ňou aj za ňou. Takýto model je vhodný na porozumenie kompletne dostupného vstupu, napríklad klasifikáciu alebo označovanie tokenov. Nie je priamo vhodný na kauzálne generovanie budúcich tokenov, pretože by počas tréningu mohol vidieť informáciu, ktorá pri generovaní ešte neexistuje.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-B-17

Odborná definícia

Odborná definícia

Bidirectional model vytvára reprezentáciu prvku sekvencie s využitím kontextu z oboch smerov. V klasických bidirectional RNN sa kombinuje sieť čítajúca sekvenciu dopredu so sieťou čítajúcou ju odzadu. V encoderových transformeroch umožňuje neobmedzená self-attention pozícii pracovať s tokenmi pred ňou aj za ňou. Takýto model je vhodný na porozumenie kompletne dostupného vstupu, napríklad klasifikáciu alebo označovanie tokenov. Nie je priamo vhodný na kauzálne generovanie budúcich tokenov, pretože by počas tréningu mohol vidieť informáciu, ktorá pri generovaní ešte neexistuje.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Pri určovaní významu slova „zámok“ pomáha vedieť, či neskôr nasleduje „na dverách“ alebo „pri rieke“. Obojsmerný model spracuje celú vetu a pri reprezentácii slova využije predchádzajúce aj nasledujúce časti. To je výhoda pri extrakcii entít, sentimentovej analýze alebo dopĺňaní maskovaného slova. Pri generovaní vety však budúce tokeny ešte nepoznáme. Autoregresívny model preto používa kauzálnu masku a vidí iba minulosť. Obojsmernosť teda nie je všeobecne lepšia, je prispôsobená inému typu úlohy.

Časté otázky

Časté otázky

Je BERT bidirectional model?

Áno. Jeho encoder pri masked language modeling vytvára reprezentácie s prístupom k ľavému aj pravému kontextu. Slovo bidirectional v názve zdôrazňuje práve tento spôsob kondicionovania reprezentácií.

Môže obojsmerný model generovať text?

Môže byť súčasťou generatívneho systému, ale klasické token-by-token generovanie vyžaduje mechanizmus, ktorý nevidí budúcnosť. Encoder sa často kombinuje s kauzálnym decoderom, ako v encoder-decoder transformeroch.

Čo je bidirectional LSTM?

Dve LSTM spracujú rovnakú sekvenciu opačnými smermi a ich hidden states sa spoja. Výstup pri každej pozícii nesie informáciu z minulého aj budúceho kontextu. Nevýhodou je nemožnosť čisto streamového spracovania bez oneskorenia.

Prečo obojsmernosť spôsobuje data leakage pri predikcii času?

Ak má model predikovať budúcnosť, vstup z neskoršieho času nesmie ovplyvniť reprezentáciu skoršieho bodu. Neopatrné použitie obojsmernej vrstvy môže poskytnúť modelu budúce pozorovania a vytvoriť nereálne validačné skóre.

Kedy je jednosmerný model vhodnejší?

Pri streamingu, online rozpoznávaní, forecastingu a autoregresívnom generovaní, kde budúci kontext nie je dostupný. Jednosmerná architektúra zodpovedá informačným obmedzeniam reálneho nasadenia.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Devlin a kol., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.