Jazykové reprezentace

vektorová reprezentace věty

Sentence embedding je vektor pevnej délky reprezentujúci význam věty, otázky nebo krátkeho textového úseku. Vzniká poolingom tokenových reprezentací nebo modelem trénovaným přímo na podobnost vět, kontrastivně páry či retrieval. Umožňuje rychle porovnávání velkého množství textů, klasifikaci a shlukování. Jeden vektor však komprimuje pořadí, detaily a několik tém, proto může být nedostatečný pro přesné logické, numerické nebo právně porovnání. Při porovnávání se musí zachovat stejná verze modelu, normalizace a poolingový postup.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-11

Odborná definice

Odborná definice

Sentence embedding je vektor pevnej délky reprezentujúci význam věty, otázky nebo krátkeho textového úseku. Vzniká poolingom tokenových reprezentací nebo modelem trénovaným přímo na podobnost vět, kontrastivně páry či retrieval. Umožňuje rychle porovnávání velkého množství textů, klasifikaci a shlukování. Jeden vektor však komprimuje pořadí, detaily a několik tém, proto může být nedostatečný pro přesné logické, numerické nebo právně porovnání. Při porovnávání se musí zachovat stejná verze modelu, normalizace a poolingový postup.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Sentence embedding je krátký číselný podpis celé věty. Dvě formulace, například „objednávku som nedostal“ a „zásielka mi neprišla“, mohou mít blízké podpisy, i když používají jiné slova. Takový podpis se dá uložit do vektorového indexu a porovnávat velmi rychle. Komprese však něco zahodí. Věty „liek se smie podať“ a „liek se nesmí podať“ jsou slovne podobné, ale rozdíl je kritický, proto je třeba model testovat i na negacích a jemných podmínkách. I malá změna předzpracování může posunout pořadí sousedů a tím změnit výsledky vyhledávání.

Časté otázky

Časté otázky

Jak se sentence embedding vytváří z tokenů?

Používá se například průměrování maskovaných tokenových vektorů, reprezentace špeciálneho tokenu nebo naučený pooling. Nejlepší způsob závisí na tréninku konkrétního modelu.

Proč běžný BERT nemusí dávať dobré vetné vektory?

BERT je předtrénovaný na tokenové úlohy a jeho surový výstup nemusí mít geometrii vhodnou na kosínusové porovnání vět. Modely jako SBERT se dolaďují na vetnou podobnost.

Jakou délku textu lze vložit do jednoho embeddingu?

Technický limit určuje model, ale informačný limit může být kratší. Dlouhý dokument se obvykle dělí na významové části, jinak jeden vektor zmieša více tém.

Je vícejazyčný sentence embedding jazykovo neutrálny?

Snaží se umiestnit preklady a významově stejné texty blízko, ale kvalita se liší podle jazyků a domén. Menší jazyky vyžadují vlastní validaci.

Lze sentence embedding použít na klasifikaci?

Ano. Vektor může vstupovat do lineárneho klasifikátora, k-nearest neighbors nebo prototypového porovnání. Výkon závisí na toho, či embedding zachycuje cílové rozlišení.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
  • Universal Sentence Encoder

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.