Reprezentace přirozeného jazyka

vektorová reprezentace slova

Word embedding je hustý numerický vektor priradený slovu nebo slovníkovej jednotke tak, aby se jeho poloha učila z distribučných vzorů v textu nebo z cílové úlohy. Statické embeddingy poskytují jednomu slovu stejný vektor ve všech vetách, zatímco kontextové modely vytvářejí reprezentaci tokenu podle okolia. Blízkost ve vektorovom prostoru může zachytit syntaktickou nebo sémantickou podobnost, ale není priamym důkazem synonymie, pravdivosti ani kauzálneho vztahu. Kvalitu ovlivňuje korpus, tokenizace, dimenze, tréninkový cíl a frekvence slov. Embedding může reprodukovat spoločenské zkreslení zdrojových dat.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-22

Odborná definice

Odborná definice

Word embedding je hustý numerický vektor priradený slovu nebo slovníkovej jednotke tak, aby se jeho poloha učila z distribučných vzorů v textu nebo z cílové úlohy. Statické embeddingy poskytují jednomu slovu stejný vektor ve všech vetách, zatímco kontextové modely vytvářejí reprezentaci tokenu podle okolia. Blízkost ve vektorovom prostoru může zachytit syntaktickou nebo sémantickou podobnost, ale není priamym důkazem synonymie, pravdivosti ani kauzálneho vztahu. Kvalitu ovlivňuje korpus, tokenizace, dimenze, tréninkový cíl a frekvence slov. Embedding může reprodukovat spoločenské zkreslení zdrojových dat.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Počítač nedokáže pracovat přímo se slovem jako člověk, proto mu přiřadí seznam čísel. Během tréninku se vektory slov, které se objavují v podobných vetách, posúvají do podobných oblastí. Tak může mít lekár bližšie k nemocnici než k motocyklu. Statický embedding však dá slovu zámok stejný vektor v dverách i v bezpečnostním mechanizme. Kontextový model tento problém řeší vytvorením nového vektora pro konkrétně použití. Ani pekná mapa vektorů nezaručuje, že model rozumie svetu nebo že podobnost odpovídá potrebám vyhledávání.

Časté otázky

Časté otázky

Jak se word embedding liší od token embedding?

Word embedding předpokládá slovnou jedničku, token embedding může reprezentovat podslovo, znak nebo špeciálny token. Moderní LLM večšinou pracují s podslovným slovníkem.

Co znamená dimenze embeddingu?

Počet čísel ve vektore. Vyšší dimenze zvyšuje kapacitu i paměť, ale sama nezaručuje kvalitnejšiu geometrii nebo lepší výkon na úloze.

Proč analógie někdy fungují vektorovou aritmetikou?

Trénink může usporiadat některé vztahy přibližně lineární. Výsledek je citlivý na korpus, normalizaci a výběr sousedů a nejde o univerzálne pravidlo.

Jak se měří podobnost slovních vektorů?

Často cosine similarity nebo dot product. Výběr metriky musí odpovídat způsobu tréninku a normalizaci, jinak pořadí sousedů nemusí být interpretovatelné.

Může embedding obsahovat bias?

Ano. Vztahy mezi profesiami, rodom, etnicitou nebo hodnotením mohou kopírovat štatistiku korpusu. Audit musí skúmat konkrétně použití a downstream důsledky.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • TensorFlow, Word embeddings Efficient Estimation of Word Representations in Vector Space

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.