Odborná definícia
Odborná definícia
Sentence embedding je vektor pevnej dĺžky reprezentujúci význam vety, otázky alebo krátkeho textového úseku. Vzniká poolingom tokenových reprezentácií alebo modelom trénovaným priamo na podobnosť viet, kontrastívne páry či retrieval. Umožňuje rýchle porovnávanie veľkého množstva textov, klasifikáciu a zhlukovanie. Jeden vektor však komprimuje poradie, detaily a viacero tém, preto môže byť nedostatočný pre presné logické, numerické alebo právne porovnanie. Pri porovnávaní sa musí zachovať rovnaká verzia modelu, normalizácia a poolingový postup.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Sentence embedding je krátky číselný podpis celej vety. Dve formulácie, napríklad „objednávku som nedostal“ a „zásielka mi neprišla“, môžu mať blízke podpisy, aj keď používajú iné slová. Takýto podpis sa dá uložiť do vektorového indexu a porovnávať veľmi rýchlo. Kompresia však niečo zahodí. Vety „liek sa smie podať“ a „liek sa nesmie podať“ sú slovne podobné, no rozdiel je kritický, preto treba model testovať aj na negáciách a jemných podmienkach. Aj malá zmena predspracovania môže posunúť poradie susedov a tým zmeniť výsledky vyhľadávania.
Časté otázky
Časté otázky
Ako sa sentence embedding vytvára z tokenov?
Používa sa napríklad priemerovanie maskovaných tokenových vektorov, reprezentácia špeciálneho tokenu alebo naučený pooling. Najlepší spôsob závisí od tréningu konkrétneho modelu.
Prečo bežný BERT nemusí dávať dobré vetné vektory?
BERT je predtrénovaný na tokenové úlohy a jeho surový výstup nemusí mať geometriu vhodnú na kosínusové porovnanie viet. Modely ako SBERT sa dolaďujú na vetnú podobnosť.
Akú dĺžku textu možno vložiť do jedného embeddingu?
Technický limit určuje model, no informačný limit môže byť kratší. Dlhý dokument sa zvyčajne delí na významové časti, inak jeden vektor zmieša viac tém.
Je viacjazyčný sentence embedding jazykovo neutrálny?
Snaží sa umiestniť preklady a významovo rovnaké texty blízko, ale kvalita sa líši podľa jazykov a domén. Menšie jazyky vyžadujú vlastnú validáciu.
Dá sa sentence embedding použiť na klasifikáciu?
Áno. Vektor môže vstupovať do lineárneho klasifikátora, k-nearest neighbors alebo prototypového porovnania. Výkon závisí od toho, či embedding zachytáva cieľové rozlíšenie.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
- Universal Sentence Encoder
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
