Odborná definice
Odborná definice
Semantic embedding je hustý číselný vektor vytvořený tak, aby vzdálenost nebo podobnost vektorů přibližně zodpovedala významové príbuznosti reprezentovaných objektů. Objektem může být slovo, věta, dokument, obraz, produkt nebo uživatel. Vektor vzniká embeddingovým modelem a jeho geometrie závisí na tréninkového cíle, dat a metriky podobnosti. Embedding neukladá význam jako slovníkovou definici a jeho souřadnice nemají samostatně stabilnou ludskou interpretaci. V produkci se sleduje i drift geometrie po výmene modelu nebo indexovaných dat.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Sémantický embedding mění obsah na bod ve viacrozmernom prostoru. Texty s podobným významom se model snaží umiestnit blízko, i když nepoužívají stejné slova. Proto může věta o zrušení rezervace najít dokument o stornování objednávky. Poloha však není univerzální. Jiný model, jazyk nebo tréninková doména vytvoří jinou mapu. Před nasazením je třeba otestovat, či blízkost opravdu odpovídá tomu, co je podobné pro daný produkt a jeho uživatelů. Při migraci embeddingového modelu se celý index zpravidla přepočítá, protože staré a nové souřadnice nejsou kompatibilní.
Časté otázky
Časté otázky
Jak se podobnost embeddingů počítá?
Nejčastěji se porovnává uhol normalizovaných vektorů, jejich dot product nebo priama geometrická vzdálenost. Metrika musí odpovídat tréningovému cielu modelu.
Je semantic embedding stejný jako sentence embedding?
Sentence embedding je konkrétní sémantický embedding pro větu nebo krátký text. Sémantické embeddingy mohou reprezentovat i dokumenty, obrázky, položky katalógu či multimodální objekty.
Proč se významově podobné texty mohou ocitnúť daleko?
Model nemusel vidět danou doménu, jazyk nebo významové rozlišení. Problém může způsobit i příliš dlouhý vstup, nevhodné pooling pravidlo nebo jiná metrika, než používal trénink.
Lze z embeddingu obnovit původní text?
Ne spolehlivě jako z běžného kódování. Vektor je ztrátová reprezentace. Navzdory tomu může unikat citlivá informace, proto embeddingy nelze automaticky považovat za anonymné.
Jak se embeddingový model validuje?
Kromě verejných benchmarků se měří recall ve vyhledávání, kvalita párů, stabilita mezi jazykmi, citlivost na negace a výkon na reálných dotazoch dané domény.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks Efficient Estimation of Word Representations in Vector Space
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
