Vyhledávání a retrieval

sémantické vyhledávání

Semantic search je vyhledávání, které porovnává význam dotazu a dokumentů, ne pouze doslovnou shodu slov. Typický systém vytvoří embedding dotazu, najde nejbližší vektory dokumentů a výsledky může dále preusporiadat presnejším rerankerom. Dokáže najít synonyma a parafráze, ale může přehlédnout přesné identifikátory, negace nebo vzácné odborné výrazy. Produkční řešení proto často kombinují vektorové a lexikálne skórování. Indexování, filtrace metadát a oprávnění musí zůstat konzistentní s vektorovým retrievalem.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-09

Odborná definice

Odborná definice

Semantic search je vyhledávání, které porovnává význam dotazu a dokumentů, ne pouze doslovnou shodu slov. Typický systém vytvoří embedding dotazu, najde nejbližší vektory dokumentů a výsledky může dále preusporiadat presnejším rerankerom. Dokáže najít synonyma a parafráze, ale může přehlédnout přesné identifikátory, negace nebo vzácné odborné výrazy. Produkční řešení proto často kombinují vektorové a lexikálne skórování. Indexování, filtrace metadát a oprávnění musí zůstat konzistentní s vektorovým retrievalem.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při klasickém vyhledávání musí dokument často obsahovat slova z otázky. Sémantické vyhledávání dokáže spojit otázku „jako ukončím predplatné“ s návodom nazvaným „zrušení členstva“. Nejprve převede otázku i obsah na vektory a hledá významově blízké položky. To je výhodné při prirodzených otázkach, ale přesný kód výrobku nebo paragraf může být lépe zachytený tradičným indexem. Hybridný systém využívá obě schopnosti a výsledky znovu zoradí. Relevantní úryvok zároveň nesmí obejít přístupová práva pouze proto, že se podobá na používatelovu otázku.

Časté otázky

Časté otázky

Čím se semantic search liší od fulltextu?

Fulltext hodnotí výskyt a významnost slov nebo fráz. Semantic search používá naučené reprezentace, takže ví najít parafrázu bez spoločných klíčových slov.

Co je bi-encoder při sémantickom vyhledávání?

Dotaz a dokument kóduje odděleně, co umožní dokumentové vektory predpočítat. Vyhledávání je rychle, ale jemné interakce mezi slovami dotazu a dokumentu se zachytia obmedzene.

K čemu slouží reranker?

Reranker vezme menší seznam kandidátů a posúdi každý pár dotaz plus dokument společně. Obvykle zlepší přesnost, ale přidává latenci a výpočetní náklady.

Jak se měří kvalita semantic search?

Používají se recall@k, precision@k, MRR, ndcg a manuálne posouzení relevantnosti. Testovací dotazy musí obsahovat i negace, zkratky, preklepy a doménové výrazy.

Proč je důležitý chunking dokumentů?

Příliš velký blok mieša více tém a embedding ztrácí přesnost. Příliš malý blok může oddělit podmínku od vysvětlení, proto se velikost a překryv testují na reálných otázkach.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Sentence Transformers, Semantic Search Dense Passage Retrieval for Open-Domain Question Answering

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.