Dáta a reprezentácie · Reprezentácia prirodzeného jazyka

Vektorová reprezentácia slova

Word embedding

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-22

Odborná definícia

Význam a odborné vymedzenie pojmu

Word embedding je hustý numerický vektor priradený slovu alebo slovníkovej jednotke tak, aby sa jeho poloha učila z distribučných vzorov v texte alebo z cieľovej úlohy. Statické embeddingy poskytujú jednému slovu rovnaký vektor vo všetkých vetách, zatiaľ čo kontextové modely vytvárajú reprezentáciu tokenu podľa okolia. Blízkosť vo vektorovom priestore môže zachytiť syntaktickú alebo sémantickú podobnosť, ale nie je priamym dôkazom synonymie, pravdivosti ani kauzálneho vzťahu. Kvalitu ovplyvňuje korpus, tokenizácia, dimenzia, tréningový cieľ a frekvencia slov. Embedding môže reprodukovať spoločenské skreslenia zdrojových dát.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Počítač nedokáže pracovať priamo so slovom ako človek, preto mu priradí zoznam čísel. Počas tréningu sa vektory slov, ktoré sa objavujú v podobných vetách, posúvajú do podobných oblastí. Tak môže mať lekár bližšie k nemocnici než k motocyklu. Statický embedding však dá slovu zámok rovnaký vektor v dverách aj v bezpečnostnom mechanizme. Kontextový model tento problém rieši vytvorením nového vektora pre konkrétne použitie. Ani pekná mapa vektorov nezaručuje, že model rozumie svetu alebo že podobnosť zodpovedá potrebám vyhľadávania.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa word embedding líši od token embedding?

Word embedding predpokladá slovnú jednotku, token embedding môže reprezentovať podslovo, znak alebo špeciálny token. Moderné LLM väčšinou pracujú s podslovným slovníkom.

Čo znamená dimenzia embeddingu?

Počet čísel vo vektore. Vyššia dimenzia zvyšuje kapacitu aj pamäť, ale sama nezaručuje kvalitnejšiu geometriu alebo lepší výkon na úlohe.

Prečo analógie niekedy fungujú vektorovou aritmetikou?

Tréning môže usporiadať niektoré vzťahy približne lineárne. Výsledok je citlivý na korpus, normalizáciu a výber susedov a nejde o univerzálne pravidlo.

Ako sa meria podobnosť slovných vektorov?

Často cosine similarity alebo dot product. Výber metriky musí zodpovedať spôsobu tréningu a normalizácii, inak poradie susedov nemusí byť interpretovateľné.

Môže embedding obsahovať bias?

Áno. Vzťahy medzi profesiami, rodom, etnicitou alebo hodnotením môžu kopírovať štatistiku korpusu. Audit musí skúmať konkrétne použitie a downstream dôsledky.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • TensorFlow, Word embeddings Efficient Estimation of Word Representations in Vector Space

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.