Vyhledávací modely a embeddingy

Model relevance pro vyhledávání

Retrieval model je funkce nebo naučený systém, který odhaduje relevanci položky vůči dotazu a umožňuje vybrat kandidátů z velkého korpusu. Sparse modely používají termínové váhy, dense bi-encodery mapují dotaz a dokument do vektorů a late-interaction přístupy zachovávají jemnější tokenové porovnání. Model musí podporovat efektivně indexování a nearest-neighbor search. Jeho skóre není automaticky srovnatelné mezi verzemi nebo dotazy a kvalita závisí na negativních příkladů a cílové domény.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-19

Odborná definice

Odborná definice

Retrieval model je funkce nebo naučený systém, který odhaduje relevanci položky vůči dotazu a umožňuje vybrat kandidátů z velkého korpusu. Sparse modely používají termínové váhy, dense bi-encodery mapují dotaz a dokument do vektorů a late-interaction přístupy zachovávají jemnější tokenové porovnání. Model musí podporovat efektivně indexování a nearest-neighbor search. Jeho skóre není automaticky srovnatelné mezi verzemi nebo dotazy a kvalita závisí na negativních příkladů a cílové domény.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Retrieval model rozhoduje, které položky se vůbec dostanou do užšieho výběru. Při dense prístupe vytvoří vektor otázky a hledá dokumenty s blízkymi vektory. To je rychle, protože dokumenty mohou být zakódované předem, ale jemné detaily interakce mezi každým slovem otázky a textu se zjednodušia. Model proto optimalizujeme hlavne na vysoký záchyt relevantních kandidátů. Přesněji, ale dražší posouzení může prísť v samostatnom rerankeri. Retrieval model se proto hodnotí zejména podle toho, co do výběru dostal, ne pouze podle prvého místa.

Časté otázky

Časté otázky

Jaký je rozdíl mezi sparse a dense retrieval modelem?

Sparse model zvýrazňuje konkrétně termíny a přesné shody, dense model pracuje se spojitými embeddingmi a lépe zachycuje parafráze. Hybrid často kombinuje jejich silné stránky.

Proč jsou důležité hard negatives?

Jsou to nerelevantné dokumenty, které se velmi podobají správným. Učí model rozlišovat jemné rozdíly, které náhodné negatíva neodhalují.

Co se stane po aktualizaci encoderu dokumentů?

Staré vektory už nemusí být kompatibilní s novým dopytovým encoderem. Index se má znovu vytvořit nebo musí existovat řízená migračná strategie.

Je cosine similarity vždy správná metrika?

Ne. Některé modely se trénují pro dot product, cosine nebo jinou funkci. Serving musí použít stejnou geometrii a normalizaci jako trénink.

Jako zistím, že model potřebuje doménový fine-tuning?

Pokud selhává na terminológii, skratkách a typických otázkach domény navzdory správnemu indexu. Potřebné jsou vlastní relevance judgments a porovnání s lexikálnym baseline.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Karpukhin et al., Dense Passage Retrieval for Open-Domain Question Answering, 2020

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.