Odborná definice
Odborná definice
Query embedding je vektor vytvořený z používatelského dotazu tak, aby se dal porovnávat s reprezentacemi dokumentů, položek nebo odpovědí. Model může používat společný encoder nebo asymetrické encodery, protože krátka otázka a dlouhý dokument mají odlišnou distribuci. Trénink využívá pozitivně páry a informatívne negatívy. Kvalita závisí na jazyka, domény, normalizace a způsobu indexování. Blízkost v prostoru není důkaz pravdivosti ani oprávnění sprístupnit dokument.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Otázka „jako reklamovat poškodenou zásielku“ se převede na souřadnice v prostoru významů. Dokument s názvem „postup při uplatnení škody během prepravy“ může ležet blízko, ačkoli nepoužívá stejné slova. Pokud query encoder nepozná právní jazyk nebo slovenčinu, umiestni otázku na nesprávně místo. Proto se nehodnotí pouze vizualizace vektorů, ale pořadí reálných dokumentů a citlivé případy s negací či číslami.
Časté otázky
Časté otázky
Musí query a dokument kódovat stejný model?
Ne. Dual-encoder může mít dvě větve trénované společně, aby vytvořili kompatibilný prostor.
Proč se vektory často normalizují?
Jednotková norma umožní používat skalárny součin jako kosínusovou podobnost a snižuje vliv rozdílné měřítka.
Jak se vybírají negativně příklady?
Náhodně, z prvních výsledků nebo hard-negative miningom. Příliš lahké negatívy nevytvoria jemnou hranici relevance.
Co spůsobí změna embedding modelu?
Vektory v indexe prestanou být kompatibilní. Dokumenty i query se musí prekódovat a systém znovu validovat.
Jak se ověřuje viacjazyčnost?
Samostatně podle jazyků, domén a typů otázek. Deklarovaný multilingual model nemusí mít stejnou geometrii pro všechny jazyky.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Karpukhin et al., Dense Passage Retrieval, 2020
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
