Jazykové reprezentácie

Sentence embedding

vektorová reprezentácia vety

Sentence embedding je vektor pevnej dĺžky reprezentujúci význam vety, otázky alebo krátkeho textového úseku. Vzniká poolingom tokenových reprezentácií alebo modelom trénovaným priamo na podobnosť viet, kontrastívne páry či retrieval. Umožňuje rýchle porovnávanie veľkého množstva textov, klasifikáciu a zhlukovanie. Jeden vektor však komprimuje poradie, detaily a viacero tém, preto môže byť nedostatočný pre presné logické, numerické alebo právne porovnanie. Pri porovnávaní sa musí zachovať rovnaká verzia modelu, normalizácia a poolingový postup.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-11

Odborná definícia

Odborná definícia

Sentence embedding je vektor pevnej dĺžky reprezentujúci význam vety, otázky alebo krátkeho textového úseku. Vzniká poolingom tokenových reprezentácií alebo modelom trénovaným priamo na podobnosť viet, kontrastívne páry či retrieval. Umožňuje rýchle porovnávanie veľkého množstva textov, klasifikáciu a zhlukovanie. Jeden vektor však komprimuje poradie, detaily a viacero tém, preto môže byť nedostatočný pre presné logické, numerické alebo právne porovnanie. Pri porovnávaní sa musí zachovať rovnaká verzia modelu, normalizácia a poolingový postup.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Sentence embedding je krátky číselný podpis celej vety. Dve formulácie, napríklad „objednávku som nedostal“ a „zásielka mi neprišla“, môžu mať blízke podpisy, aj keď používajú iné slová. Takýto podpis sa dá uložiť do vektorového indexu a porovnávať veľmi rýchlo. Kompresia však niečo zahodí. Vety „liek sa smie podať“ a „liek sa nesmie podať“ sú slovne podobné, no rozdiel je kritický, preto treba model testovať aj na negáciách a jemných podmienkach. Aj malá zmena predspracovania môže posunúť poradie susedov a tým zmeniť výsledky vyhľadávania.

Časté otázky

Časté otázky

Ako sa sentence embedding vytvára z tokenov?

Používa sa napríklad priemerovanie maskovaných tokenových vektorov, reprezentácia špeciálneho tokenu alebo naučený pooling. Najlepší spôsob závisí od tréningu konkrétneho modelu.

Prečo bežný BERT nemusí dávať dobré vetné vektory?

BERT je predtrénovaný na tokenové úlohy a jeho surový výstup nemusí mať geometriu vhodnú na kosínusové porovnanie viet. Modely ako SBERT sa dolaďujú na vetnú podobnosť.

Akú dĺžku textu možno vložiť do jedného embeddingu?

Technický limit určuje model, no informačný limit môže byť kratší. Dlhý dokument sa zvyčajne delí na významové časti, inak jeden vektor zmieša viac tém.

Je viacjazyčný sentence embedding jazykovo neutrálny?

Snaží sa umiestniť preklady a významovo rovnaké texty blízko, ale kvalita sa líši podľa jazykov a domén. Menšie jazyky vyžadujú vlastnú validáciu.

Dá sa sentence embedding použiť na klasifikáciu?

Áno. Vektor môže vstupovať do lineárneho klasifikátora, k-nearest neighbors alebo prototypového porovnania. Výkon závisí od toho, či embedding zachytáva cieľové rozlíšenie.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
  • Universal Sentence Encoder

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.