Odborná definice
Odborná definice
Universal Sentence Encoder je rodina predtrénovaných modelů společnosti Google, které mapují věty nebo kratšie texty do pevných hustých vektorů určených pro přenos mezi NLP úlohami. Původní varianty využívali transformer nebo Deep Averaging Network a učili se na kombinaci konverzačních, inferenčných a dalších jazykových cílů. Vektory lze použít na podobnost, klasifikaci, shlukování nebo retrieval bez tréninku velkého encoderu od nuly. Označení universal neznamená stejnou kvalitu pro každý jazyk, doménu a délku textu. Model, modul, normalizace a způsob dávkování se ukladají jako jedna verzovaná embeddingová pipeline.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Místo toho, aby firma trénovala vlastní jazykový model, může větu poslat do hotového encoderu a dostat několik stoviek čísel. Podobné významy mají mít blízké vektory, takže se dají vyhladávat otázky, triedit tikety nebo vytvořit jednoduchý klasifikátor. Model je univerzální v smyslu přenosu na více úloh, ne v smyslu bezchybného porozumění. Při slovenčine, odbornej terminológii a dlouhých dokumentech je třeba ověřit konkrétní variant a porovnat ho s novšími embeddingovými modely. Při změně encoderu se staré a nové vektory nemiešají v jednom indexe bez explicitného mapování a porovnání retrievalu.
Časté otázky
Časté otázky
Jaký rozměr má Universal Sentence Encoder?
Běžné původní varianty vytvářejí 512-rozměrný vektor, ale přesný rozměr a limity závisí na konkrétního modulu a jeho verze.
Je USE vícejazyčný?
Existují vícejazyčné varianty trénované na přenos mezi jazykmi. Pokrytí jazyka však nezaručuje stejný retrieval výkon, proto je potřebný lokální benchmark.
Lze encoder dolaďovat?
Některé implementace lze zapojit do trénovatelnej pipeline, jiné se používají jako zmrazený modul. Dolaďování vyžaduje kontrolu, či nezhorší obecný prostor.
Jak se měří kvalita embeddingů?
Používá se retrieval recall, rankingové metriky, klasifikace s jednoduchou hlavou, korelace se sémantickou podobností a test ťažkých negativních příkladů.
Je USE vhodný pro celé dokumenty?
Byl navržený zejména pro věty a kratší text. Dlouhý dokument je vhodnější rozdelit na významové části nebo použít model s validovaným dlhším kontextem.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Universal Sentence Encoder
- TensorFlow Hub, Universal Sentence Encoder
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
