Odborná definícia
Význam a odborné vymedzenie pojmu
Text embedding je hustý číselný vektor vytvorený modelom tak, aby zachytával vybrané významové alebo funkčné vlastnosti textu. Používa sa na podobnosť, vyhľadávanie, zhlukovanie, klasifikáciu a retrieval. Význam vzdialenosti závisí od tréningového cieľa, modelu, poolingu a normalizácie. Embedding nie je jednoznačný odtlačok významu ani dôkaz faktickej zhody. Pri zmene modelu sa vektorový priestor zmení a uložený index sa spravidla musí prepočítať. Retrieval test má obsahovať synonymá, negácie, čísla, skratky aj veľmi podobné, ale nesprávne dokumenty.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Dve vety s rozdielnymi slovami môžu dostať blízke súradnice, ak vyjadrujú podobný zámer. To umožní nájsť návod o zrušení členstva aj pri otázke, ako ukončiť predplatné. Vektor však komprimuje text a niektoré rozdiely môže potlačiť. Negácia, číslo alebo právna podmienka môžu byť pre človeka rozhodujúce, hoci embeddingy zostanú blízke. Preto sa retrieval často kombinuje s filtrom metadát, rerankerom a kontrolou samotného úryvku, nie iba s kosínusovou podobnosťou. Najbližší vektor je iba kandidát, ktorého význam a oprávnenie musí aplikácia ešte overiť.
Časté otázky
Otázky, ktoré spresňujú význam
Ako sa text embedding líši od token embeddingu?
Text embedding zhrnie vetu alebo dokument do jedného vektora. Token embedding reprezentuje jednotlivý token pred alebo počas kontextového spracovania.
Ktorá metrika sa používa na porovnanie?
Často kosínusová podobnosť, skalárny súčin alebo euklidovská vzdialenosť. Správna voľba závisí od tréningu modelu a od toho, či sú vektory normalizované.
Môžu embeddingy porovnávať viac jazykov?
Viacjazyčný model môže umiestniť preklady blízko seba, ale kvalita sa líši podľa jazykov, domén a dĺžky textu. Slovenčina potrebuje vlastný testovací súbor.
Prečo sa dokumenty delia na chunky?
Jeden vektor dlhého dokumentu zmieša viac tém. Menšie významové bloky zlepšia lokalizáciu odpovede, no príliš krátke časti môžu oddeliť podmienku od kontextu.
Ako sa migruje na nový embeddingový model?
Všetky dokumenty sa znovu zakódujú, vytvorí sa nový index a porovnajú sa retrieval metriky. Staré a nové vektory sa nemajú bez overenia miešať.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
