Odborná definice
Odborná definice
Text embedding je hustý číselný vektor vytvořený modelem tak, aby zachytával vybrané významové nebo funkční vlastnosti textu. Používá se na podobnost, vyhledávání, shlukování, klasifikaci a retrieval. Význam vzdálenosti závisí na tréninkového cíle, modelu, poolingu a normalizace. Embedding není jednoznačný odtlačok významu ani důkaz faktickej shody. Při změně modelu se vektorový prostor změní a uložený index se zpravidla musí prepočítat. Retrieval test má obsahovat synonyma, negace, čísla, zkratky i velmi podobné, ale nesprávně dokumenty.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Dvě věty s rozdielnymi slovami mohou dostat blízké souřadnice, pokud vyjadrují podobný záměr. To umožní najít návod o zrušení členstva i při otázce, jako ukončit predplatné. Vektor však komprimuje text a některé rozdíly může potlačit. Negace, číslo nebo právní podmínka mohou být pro člověka rozhodující, ačkoli embeddingy zůstanou blízké. Proto se retrieval často kombinuje s filtrom metadát, rerankerom a kontrolou samotného úryvku, ne pouze s kosínusovou podobností. Najbližší vektor je pouze kandidát, kterého význam a oprávnění musí aplikace ještě ověřit.
Časté otázky
Časté otázky
Jak se text embedding liší od token embeddingu?
Text embedding shrne větu nebo dokument do jednoho vektora. Token embedding reprezentuje jednotlivý token před nebo během kontextového zpracování.
Která metrika se používá na porovnání?
Často kosínusová podobnost, skalárny součin nebo euklidovská vzdálenost. Správná volba závisí na tréninku modelu a od toho, zda jsou vektory normalizované.
Mohou embeddingy porovnávat více jazyků?
Vícejazyčný model může umiestnit preklady blízko sebe, ale kvalita se liší podle jazyků, domén a délky textu. Slovenčina potřebuje vlastní testovací soubor.
Proč se dokumenty dělí na chunky?
Jeden vektor dlhého dokumentu zmieša více tém. Menší významové bloky zlepšia lokalizaci odpovědi, ale příliš krátké části mohou oddělit podmínku od kontextu.
Jak se migruje na nový embeddingový model?
Všechny dokumenty se znovu zakódují, vytvoří se nový index a porovnají se retrieval metriky. Staré a nové vektory se nemají bez ověření miešat.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
