Textové embeddingy

Universal Sentence Encoder

univerzálny encoder viet

Universal Sentence Encoder je rodina predtrénovaných modelov spoločnosti Google, ktoré mapujú vety alebo kratšie texty do pevných hustých vektorov určených pre prenos medzi NLP úlohami. Pôvodné varianty využívali transformer alebo Deep Averaging Network a učili sa na kombinácii konverzačných, inferenčných a ďalších jazykových cieľov. Vektory možno použiť na podobnosť, klasifikáciu, zhlukovanie alebo retrieval bez tréningu veľkého encoderu od nuly. Označenie universal neznamená rovnakú kvalitu pre každý jazyk, doménu a dĺžku textu. Model, modul, normalizácia a spôsob dávkovania sa ukladajú ako jedna verzovaná embeddingová pipeline.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-15

Odborná definícia

Odborná definícia

Universal Sentence Encoder je rodina predtrénovaných modelov spoločnosti Google, ktoré mapujú vety alebo kratšie texty do pevných hustých vektorov určených pre prenos medzi NLP úlohami. Pôvodné varianty využívali transformer alebo Deep Averaging Network a učili sa na kombinácii konverzačných, inferenčných a ďalších jazykových cieľov. Vektory možno použiť na podobnosť, klasifikáciu, zhlukovanie alebo retrieval bez tréningu veľkého encoderu od nuly. Označenie universal neznamená rovnakú kvalitu pre každý jazyk, doménu a dĺžku textu. Model, modul, normalizácia a spôsob dávkovania sa ukladajú ako jedna verzovaná embeddingová pipeline.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Namiesto toho, aby firma trénovala vlastný jazykový model, môže vetu poslať do hotového encoderu a dostať niekoľko stoviek čísel. Podobné významy majú mať blízke vektory, takže sa dajú vyhľadávať otázky, triediť tikety alebo vytvoriť jednoduchý klasifikátor. Model je univerzálny v zmysle prenosu na viac úloh, nie v zmysle bezchybného porozumenia. Pri slovenčine, odbornej terminológii a dlhých dokumentoch treba overiť konkrétny variant a porovnať ho s novšími embeddingovými modelmi. Pri zmene encoderu sa staré a nové vektory nemiešajú v jednom indexe bez explicitného mapovania a porovnania retrievalu.

Časté otázky

Časté otázky

Aký rozmer má Universal Sentence Encoder?

Bežné pôvodné varianty vytvárajú 512-rozmerný vektor, no presný rozmer a limity závisia od konkrétneho modulu a jeho verzie.

Je USE viacjazyčný?

Existujú viacjazyčné varianty trénované na prenos medzi jazykmi. Pokrytie jazyka však nezaručuje rovnaký retrieval výkon, preto je potrebný lokálny benchmark.

Dá sa encoder dolaďovať?

Niektoré implementácie možno zapojiť do trénovateľnej pipeline, iné sa používajú ako zmrazený modul. Dolaďovanie vyžaduje kontrolu, či nezhorší všeobecný priestor.

Ako sa meria kvalita embeddingov?

Používa sa retrieval recall, rankingové metriky, klasifikácia s jednoduchou hlavou, korelácia so sémantickou podobnosťou a test ťažkých negatívnych príkladov.

Je USE vhodný pre celé dokumenty?

Bol navrhnutý najmä pre vety a kratší text. Dlhý dokument je vhodnejšie rozdeliť na významové časti alebo použiť model s validovaným dlhším kontextom.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Universal Sentence Encoder
  • TensorFlow Hub, Universal Sentence Encoder

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.