Získavání relevantného důkazu pro AI

Vyhledávání znalostí

Knowledge retrieval je proces identifikace a načítání faktů, dokumentů, pasáží, grafových prvků nebo záznamů, které jsou relevantní pro konkrétní znalostní potřebu. Zahrnuje formulaci dotazu, výběr kolekce, kandidátne vyhledávání, filtrování, reranking a sestavení kontextu. Na rozdíl od generování má vrátit důkaz nebo jeho adresu. Kvalitu určuje recall relevantních zdrojů, přesnost pořadí, aktuálnost, oprávnění, rozmanitost a vhodná granularita. Výsledkem může být prázdna množina, pokud žiadny kandidát neprejde minimálnym prahem důvěry.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-24

Odborná definice

Odborná definice

Knowledge retrieval je proces identifikace a načítání faktů, dokumentů, pasáží, grafových prvků nebo záznamů, které jsou relevantní pro konkrétní znalostní potřebu. Zahrnuje formulaci dotazu, výběr kolekce, kandidátne vyhledávání, filtrování, reranking a sestavení kontextu. Na rozdíl od generování má vrátit důkaz nebo jeho adresu. Kvalitu určuje recall relevantních zdrojů, přesnost pořadí, aktuálnost, oprávnění, rozmanitost a vhodná granularita. Výsledkem může být prázdna množina, pokud žiadny kandidát neprejde minimálnym prahem důvěry.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Otázka Kdy lze odstúpit od smlouvy se nejprve převede na dotaz. Systém prehladá právně dokumenty, najde odseky o lehote a výnimkách, odfiltruje starou verzi a zoradí pasáže podle relevance. Až potom generátor vytvoří odpověď. Pokud retrieval vrátí jen obecnou pasáž a vynechá rozhodujúcu výnimku, generátor ji nemá z čeho získat. Proto se chyba retrieval vrstvy musí měřit odděleně od kvality formulace odpovědi. Při vysoké stávke má uživatel dostat i nájdený odsek, ne pouze hladko formulovanou odpověď.

Časté otázky

Časté otázky

Jak se liší knowledge retrieval od information retrieval?

Information retrieval je širší disciplína vyhledávání dokumentů podle informační potřeby. Knowledge retrieval zdůrazňuje použití nájdeného obsahu jako explicitného důkazu pro odpověď, reasoning nebo rozhodovací proces.

Co je hybridní vyhledávání?

Kombinuje lexikálne skóre, například BM25, s hustou vektorovou podobností a případně metadátovými filtrami. Lexikálna složka chrání přesné termíny, vektorová zachycuje významové parafráze.

Proč je chunking součástí retrieval kvality?

Příliš krátký úsek ztratí kontext a výjimky, příliš dlouhý zriedi relevantní větu a spotrebuje tokeny. Granularita se volí podle struktury dokumentů a hodnotí na reálných otázkach.

Co dělá reranker?

Dostane menší seznam kandidátů z rýchleho retrievera a přesněji posúdi vztah otázky a pasáže. Zvyšuje kvalitu top výsledků, ale přidává latenci a musí respektovat filtry a oprávnění.

Jak se testuje retrieval bez generátora?

Používá se sada otázek s označenými relevantnými zdroji a metriky recall@k, precision@k, MRR nebo ndcg. Je třeba zvlášť sledovat kritické případy, čerstvost a neoprávnené výsledky.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Lewis a kol., Retrieval-Augmented Generation Karpukhin a kol., Dense Passage Retrieval

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.