Vyhľadávanie a znalosti · Reprezentácie a vyhľadávanie

Vektorová reprezentácia textu

Text embedding

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-11

Odborná definícia

Význam a odborné vymedzenie pojmu

Text embedding je hustý číselný vektor vytvorený modelom tak, aby zachytával vybrané významové alebo funkčné vlastnosti textu. Používa sa na podobnosť, vyhľadávanie, zhlukovanie, klasifikáciu a retrieval. Význam vzdialenosti závisí od tréningového cieľa, modelu, poolingu a normalizácie. Embedding nie je jednoznačný odtlačok významu ani dôkaz faktickej zhody. Pri zmene modelu sa vektorový priestor zmení a uložený index sa spravidla musí prepočítať. Retrieval test má obsahovať synonymá, negácie, čísla, skratky aj veľmi podobné, ale nesprávne dokumenty.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Dve vety s rozdielnymi slovami môžu dostať blízke súradnice, ak vyjadrujú podobný zámer. To umožní nájsť návod o zrušení členstva aj pri otázke, ako ukončiť predplatné. Vektor však komprimuje text a niektoré rozdiely môže potlačiť. Negácia, číslo alebo právna podmienka môžu byť pre človeka rozhodujúce, hoci embeddingy zostanú blízke. Preto sa retrieval často kombinuje s filtrom metadát, rerankerom a kontrolou samotného úryvku, nie iba s kosínusovou podobnosťou. Najbližší vektor je iba kandidát, ktorého význam a oprávnenie musí aplikácia ešte overiť.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa text embedding líši od token embeddingu?

Text embedding zhrnie vetu alebo dokument do jedného vektora. Token embedding reprezentuje jednotlivý token pred alebo počas kontextového spracovania.

Ktorá metrika sa používa na porovnanie?

Často kosínusová podobnosť, skalárny súčin alebo euklidovská vzdialenosť. Správna voľba závisí od tréningu modelu a od toho, či sú vektory normalizované.

Môžu embeddingy porovnávať viac jazykov?

Viacjazyčný model môže umiestniť preklady blízko seba, ale kvalita sa líši podľa jazykov, domén a dĺžky textu. Slovenčina potrebuje vlastný testovací súbor.

Prečo sa dokumenty delia na chunky?

Jeden vektor dlhého dokumentu zmieša viac tém. Menšie významové bloky zlepšia lokalizáciu odpovede, no príliš krátke časti môžu oddeliť podmienku od kontextu.

Ako sa migruje na nový embeddingový model?

Všetky dokumenty sa znovu zakódujú, vytvorí sa nový index a porovnajú sa retrieval metriky. Staré a nové vektory sa nemajú bez overenia miešať.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.