Vyhledávání informací a knowledge systems

Vyhledávání relevantních položek

Retrieval je proces identifikace a seřazení položek z korpusu podle jejich relevance k dotazu nebo informační potrebe. Zahrnuje vytvoření indexu, reprezentaci dotazu, matching, scoring a výběr top-k kandidátů. Lexikálne metody pracují s termínmi a štatistikou výskytu, dense retrieval s embeddingmi, hybridní systémy kombinují oba signály. Retrieval se liší od generování, protože vrací existujúce dokumenty nebo objekty. Kvalitu určují pokrytí korpusu, čerstvost indexu, filtry, relevance judgments a latence.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-17

Odborná definice

Odborná definice

Retrieval je proces identifikace a seřazení položek z korpusu podle jejich relevance k dotazu nebo informační potrebe. Zahrnuje vytvoření indexu, reprezentaci dotazu, matching, scoring a výběr top-k kandidátů. Lexikálne metody pracují s termínmi a štatistikou výskytu, dense retrieval s embeddingmi, hybridní systémy kombinují oba signály. Retrieval se liší od generování, protože vrací existujúce dokumenty nebo objekty. Kvalitu určují pokrytí korpusu, čerstvost indexu, filtry, relevance judgments a latence.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Retrieval je knižničná část AI systému. Dostane otázku a z velkého skladu vybere malé množství dokumentů, které pravděpodobně obsahují odpověď. Přesná shoda slov pomáhá při názvoch, kódoch a citacích, významové vektory zas při parafrázach. Výsledkem není nová odpověď, ale seznam existujúcich položek s pořadím nebo skóre. Pokud je dokument špatně rozdělený, chybí v indexe nebo ho filtr vylúči, další generativní model ho už nemůže použít. Kvalita indexu a prístupových filtrů je proto stejně důležitá jako kvalita samotného modelu.

Časté otázky

Časté otázky

Jaký je rozdíl mezi retrievalem a webovým vyhladávačom?

Webový vyhladávač je rozsiahla aplikace s crawlingom, indexem, rankingom a UI. Retrieval je všeobecná technická funkce výběru relevantních položek z lubovolného korpusu.

Jak se volí hodnota top-k?

Vyšší k zvyšuje šancu na záchyt relevantného dokumentu, ale přidává šum, náklady a dlhší kontext. Hodnota se ladí spolu s rerankingom a limitem generátora.

Co způsobuje zastaraný retrieval?

Index nemusí obsahovat nové nebo zmenené dokumenty, případně drží staré embeddingy. Potřebné jsou inkrementální aktualizace, verzování a kontrola času poslední synchronizace.

K čemu jsou metadata filtry?

Obmedze vyhledávání podle jazyka, dátumu, produktu, oprávnění nebo typu dokumentu. Filtr musí být aplikovaný bezpečně, aby retrieval neobišiel přístupové pravidla.

Jak se retrieval hodnotí?

Na sade dotazů s označenými relevantnými položkami pomocí Recall@k, MRR, MAP nebo ndcg. Při knowledge base je třeba pravidelne doplňat reálně neúspešné dopyty.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Manning, Raghavan and Schuetze, Introduction to Information Retrieval

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.