Odborná definice
Odborná definice
Token embedding je naučený vektor priradený identifikátoru tokenu v slovníku modelu. Tvoří základnou numerickou reprezentaci před spracováním kontextovými vrstvami a často se kombinuje s pozičnou nebo segmentovou informací. Stejný token začíná s stejným vstupním embeddingom bez ohladu na větu, ale jeho neskoršia kontextová reprezentace se mění podle okolia. Embeddingová matice patří mezi parametry modelu a může být zdielaná s výstupnou projekcí logits. Při rozšíření slovníka je třeba inicializovat nové řádky embeddingovej matice a zachovat správně ID špeciálnych tokenů.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Tokenizer převede slovo nebo jeho část na číslo. Toto číslo samo nenese význam, proto se použije jako index do velké tabulky vektorů. Vybraný řádek je token embedding. Na začátku tréninku je pouze číselný parameter, postupně se však upraví tak, aby pomáhal predikci. Slovo s více významami má stále stejný vstupní vektor. Rozlišení, či „banka“ znamená inštitúci nebo breh, vznikne až v dalších vrstvách, které zohladnia okolité tokeny a pozici. Nesprávně posunuté ID může přiřadit známemu slovu zcela jiný vektor bez zjavnej chyby v kóde.
Časté otázky
Časté otázky
Je token embedding kontextový?
Vstupní embedding z embeddingovej tabulky zpravidla není kontextový. Kontextové reprezentace vznikají až po attention nebo jiných sekvenčních vrstvách.
Jaký rozměr má token embedding?
Obvykle odpovídá skrytému rozmeru modelu. Větší rozměr zvyšuje kapacitu i počet parametrů a pameťové nároky embeddingovej matice.
Co je weight tying?
Vstupní embeddingová matice se zdiela s maticou, která mapuje skryté stavy na logity slovníka. Snižuje počet parametrů a může zlepšit učení.
Jak se reprezentuje neznámý token?
Starší tokenizéry používali špeciálny UNK token. Subword a bajtové tokenizéry rozložia neznámý řetězec na menší známé jednotky, čím UNK obmedze.
Mění fine-tuning token embeddingy?
Pokud nejsou zmrazené, gradient jejich může upravit spolu s ostatnými parametry. Při malém datasete může velká změna poškodit obecnou jazykovou reprezentaci.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- PyTorch Embedding documentation Using the Output Embedding to Improve Language Models
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
