Základy umělé inteligence · Indexování, ranking a vyhledávací systémy

Vyhledávání informací

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-20

Odborná definice

Význam a odborné vymezení pojmu

Information retrieval je disciplína návrhu systémů, které z velké kolekce vyberou a zoradia dokumenty nebo objekty relevantní k informační potrebe uživatele. Pipeline zahrnuje zpracování dotazu, index, výpočet shody, ranking, prípadné rerankování a prezentaci výsledků. Lexikálne metody pracují s výskytom slov, husté vyhledávání porovnává embeddingy a hybridný přístup kombinuje oba signály. Relevantnost není totožná s pravdivosťou ani autoritou, proto ranking potřebuje další kritéria. Hodnocení používá anotované dotazy a metriky jako precision, recall, MRR nebo ndcg, přičemž produkční systém musí sledovat čerstvost, diverzitu a chování uživatelů.

Srozumitelné vysvětlení

Jak se pojem používá v praxi

Uživatel napíše do firemného vyhladávača otázku o výpovednej lehote. Systém nemusí hned vytvořit odpověď, nejprve má najít najvhodnejšie smlouvy a pasáže. Klasický index zachytí přesný výraz, vektorový index může najít i formulaci ukončení spolupráce. Reranker potom porovná celý dotaz s kandidátmi a upraví pořadí. Dokument může být tematicky podobný, ale zastaraný nebo patrit jinému klientovi, proto se pridají filtry a časová platnost. Kvalita vyhledávání se měří tím, zda se relevantní důkaz objeví dostatečně vysoce, ne tím, jako presvedčivo zní generovaná odpověď.

Časté otázky

Otázky, které upřesňují význam

Jaký je rozdíl mezi retrieval a search engine?

Information retrieval je vedecký a technický rámec výběru relevantních položek. Vyhladávač je konkrétní systém, který kromě rankingu řeší crawling, rozhraní, reklamu, filtry a prevádzku.

Co dělá BM25?

Je lexikálna rankingová funkce založená na frekvencii termínu, jeho vzácnosti v kolekcii a normalizaci délky dokumentu. Dobře zachycuje přesné slova, ale ne vždy synonyma a parafráze.

Kdy pomáhá dense retrieval?

Když dotaz a relevantní dokument používají odlišný slovník nebo je třeba porovnávat sémantiku. Výsledek závisí na embeddingového modelu a může minúť přesný identifikátor či odborný termín.

Proč se používá reranker?

První fáza rychle vybere stovky kandidátů. Přesnější, ale drahší model potom posúdi každou dvojicu dotaz a dokument a přesune najrelevantnejšie položky vyšší.

Jako retrieval souvisí s RAG?

RAG použije vyhledávání na dodání důkazů generátoru. Pokud retrieval nenájde správnou pasáž, jazykový model nemá z čeho vytvořit podloženou odpověď, proto se obě vrstvy hodnotí odděleně.

Související pojmy

Významové a tematické souvislosti

Zdroje a redakční stopa

Použitá východiska a odborná revize

  • Manning, Raghavan a Schütze, Introduction to Information Retrieval (nlp.stanford.edu)
  • NIST Text REtrieval Conference (trec.nist.gov)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.