Odborná definícia
Odborná definícia
Token embedding je naučený vektor priradený identifikátoru tokenu v slovníku modelu. Tvorí základnú numerickú reprezentáciu pred spracovaním kontextovými vrstvami a často sa kombinuje s pozičnou alebo segmentovou informáciou. Rovnaký token začína s rovnakým vstupným embeddingom bez ohľadu na vetu, no jeho neskoršia kontextová reprezentácia sa mení podľa okolia. Embeddingová matica patrí medzi parametre modelu a môže byť zdieľaná s výstupnou projekciou logits. Pri rozšírení slovníka treba inicializovať nové riadky embeddingovej matice a zachovať správne ID špeciálnych tokenov.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Tokenizer prevedie slovo alebo jeho časť na číslo. Toto číslo samo nenesie význam, preto sa použije ako index do veľkej tabuľky vektorov. Vybraný riadok je token embedding. Na začiatku tréningu je iba číselný parameter, postupne sa však upraví tak, aby pomáhal predikcii. Slovo s viacerými významami má stále rovnaký vstupný vektor. Rozlíšenie, či „banka“ znamená inštitúciu alebo breh, vznikne až v ďalších vrstvách, ktoré zohľadnia okolité tokeny a pozíciu. Nesprávne posunuté ID môže priradiť známemu slovu úplne iný vektor bez zjavnej chyby v kóde.
Časté otázky
Časté otázky
Je token embedding kontextový?
Vstupný embedding z embeddingovej tabuľky spravidla nie je kontextový. Kontextové reprezentácie vznikajú až po attention alebo iných sekvenčných vrstvách.
Aký rozmer má token embedding?
Zvyčajne zodpovedá skrytému rozmeru modelu. Väčší rozmer zvyšuje kapacitu aj počet parametrov a pamäťové nároky embeddingovej matice.
Čo je weight tying?
Vstupná embeddingová matica sa zdieľa s maticou, ktorá mapuje skryté stavy na logity slovníka. Znižuje počet parametrov a môže zlepšiť učenie.
Ako sa reprezentuje neznámy token?
Staršie tokenizéry používali špeciálny UNK token. Subword a bajtové tokenizéry rozložia neznámy reťazec na menšie známe jednotky, čím UNK obmedzia.
Mení fine-tuning token embeddingy?
Ak nie sú zmrazené, gradient ich môže upraviť spolu s ostatnými parametrami. Pri malom datasete môže veľká zmena poškodiť všeobecnú jazykovú reprezentáciu.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- PyTorch Embedding documentation Using the Output Embedding to Improve Language Models
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
