Odborná definícia
Odborná definícia
Bidirectional model vytvára reprezentáciu prvku sekvencie s využitím kontextu z oboch smerov. V klasických bidirectional RNN sa kombinuje sieť čítajúca sekvenciu dopredu so sieťou čítajúcou ju odzadu. V encoderových transformeroch umožňuje neobmedzená self-attention pozícii pracovať s tokenmi pred ňou aj za ňou. Takýto model je vhodný na porozumenie kompletne dostupného vstupu, napríklad klasifikáciu alebo označovanie tokenov. Nie je priamo vhodný na kauzálne generovanie budúcich tokenov, pretože by počas tréningu mohol vidieť informáciu, ktorá pri generovaní ešte neexistuje.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Pri určovaní významu slova „zámok“ pomáha vedieť, či neskôr nasleduje „na dverách“ alebo „pri rieke“. Obojsmerný model spracuje celú vetu a pri reprezentácii slova využije predchádzajúce aj nasledujúce časti. To je výhoda pri extrakcii entít, sentimentovej analýze alebo dopĺňaní maskovaného slova. Pri generovaní vety však budúce tokeny ešte nepoznáme. Autoregresívny model preto používa kauzálnu masku a vidí iba minulosť. Obojsmernosť teda nie je všeobecne lepšia, je prispôsobená inému typu úlohy.
Časté otázky
Časté otázky
Je BERT bidirectional model?
Áno. Jeho encoder pri masked language modeling vytvára reprezentácie s prístupom k ľavému aj pravému kontextu. Slovo bidirectional v názve zdôrazňuje práve tento spôsob kondicionovania reprezentácií.
Môže obojsmerný model generovať text?
Môže byť súčasťou generatívneho systému, ale klasické token-by-token generovanie vyžaduje mechanizmus, ktorý nevidí budúcnosť. Encoder sa často kombinuje s kauzálnym decoderom, ako v encoder-decoder transformeroch.
Čo je bidirectional LSTM?
Dve LSTM spracujú rovnakú sekvenciu opačnými smermi a ich hidden states sa spoja. Výstup pri každej pozícii nesie informáciu z minulého aj budúceho kontextu. Nevýhodou je nemožnosť čisto streamového spracovania bez oneskorenia.
Prečo obojsmernosť spôsobuje data leakage pri predikcii času?
Ak má model predikovať budúcnosť, vstup z neskoršieho času nesmie ovplyvniť reprezentáciu skoršieho bodu. Neopatrné použitie obojsmernej vrstvy môže poskytnúť modelu budúce pozorovania a vytvoriť nereálne validačné skóre.
Kedy je jednosmerný model vhodnejší?
Pri streamingu, online rozpoznávaní, forecastingu a autoregresívnom generovaní, kde budúci kontext nie je dostupný. Jednosmerná architektúra zodpovedá informačným obmedzeniam reálneho nasadenia.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Devlin a kol., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
