Informačné vyhľadávanie a knowledge systems

Retrieval

Vyhľadávanie relevantných položiek

Retrieval je proces identifikácie a zoradenia položiek z korpusu podľa ich relevancie k dopytu alebo informačnej potrebe. Zahŕňa vytvorenie indexu, reprezentáciu dopytu, matching, scoring a výber top-k kandidátov. Lexikálne metódy pracujú s termínmi a štatistikou výskytu, dense retrieval s embeddingmi, hybridné systémy kombinujú oba signály. Retrieval sa líši od generovania, pretože vracia existujúce dokumenty alebo objekty. Kvalitu určujú pokrytie korpusu, čerstvosť indexu, filtre, relevance judgments a latencia.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-R-17

Odborná definícia

Odborná definícia

Retrieval je proces identifikácie a zoradenia položiek z korpusu podľa ich relevancie k dopytu alebo informačnej potrebe. Zahŕňa vytvorenie indexu, reprezentáciu dopytu, matching, scoring a výber top-k kandidátov. Lexikálne metódy pracujú s termínmi a štatistikou výskytu, dense retrieval s embeddingmi, hybridné systémy kombinujú oba signály. Retrieval sa líši od generovania, pretože vracia existujúce dokumenty alebo objekty. Kvalitu určujú pokrytie korpusu, čerstvosť indexu, filtre, relevance judgments a latencia.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Retrieval je knižničná časť AI systému. Dostane otázku a z veľkého skladu vyberie malé množstvo dokumentov, ktoré pravdepodobne obsahujú odpoveď. Presná zhoda slov pomáha pri názvoch, kódoch a citáciách, významové vektory zas pri parafrázach. Výsledkom nie je nová odpoveď, ale zoznam existujúcich položiek s poradím alebo skóre. Ak je dokument zle rozdelený, chýba v indexe alebo ho filter vylúči, ďalší generatívny model ho už nemôže použiť. Kvalita indexu a prístupových filtrov je preto rovnako dôležitá ako kvalita samotného modelu.

Časté otázky

Časté otázky

Aký je rozdiel medzi retrievalom a webovým vyhľadávačom?

Webový vyhľadávač je rozsiahla aplikácia s crawlingom, indexom, rankingom a UI. Retrieval je všeobecná technická funkcia výberu relevantných položiek z ľubovoľného korpusu.

Ako sa volí hodnota top-k?

Vyššie k zvyšuje šancu na záchyt relevantného dokumentu, ale pridáva šum, náklady a dlhší kontext. Hodnota sa ladí spolu s rerankingom a limitom generátora.

Čo spôsobuje zastaraný retrieval?

Index nemusí obsahovať nové alebo zmenené dokumenty, prípadne drží staré embeddingy. Potrebné sú inkrementálne aktualizácie, verzovanie a kontrola času poslednej synchronizácie.

Načo sú metadata filtre?

Obmedzia vyhľadávanie podľa jazyka, dátumu, produktu, oprávnenia alebo typu dokumentu. Filter musí byť aplikovaný bezpečne, aby retrieval neobišiel prístupové pravidlá.

Ako sa retrieval hodnotí?

Na sade dopytov s označenými relevantnými položkami pomocou Recall@k, MRR, MAP alebo nDCG. Pri knowledge base treba pravidelne dopĺňať reálne neúspešné dopyty.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Manning, Raghavan and Schuetze, Introduction to Information Retrieval

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.