Vektorové vyhledávání a indexování

Vyhledávání k nejbližších sousedů

K-nearest neighbor search je výpočetní úloha najít pro dotazový bod k objektů s najmenšou vzdáleností nebo največšou podobností v referenční kolekcii. Přesné řešení garantuje skutečných sousedů podle dané metriky, aproximované řešení obetuje část recallu za nižší latenci a paměť. Implementace může používat brute force, stromové indexy, grafové struktury, kvantizaci nebo kombinované filtry. Top k je definované vůči konkrétnímu indexu, metrice a verzi vektorovej reprezentace.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-06

Odborná definice

Odborná definice

K-nearest neighbor search je výpočetní úloha najít pro dotazový bod k objektů s najmenšou vzdáleností nebo največšou podobností v referenční kolekcii. Přesné řešení garantuje skutečných sousedů podle dané metriky, aproximované řešení obetuje část recallu za nižší latenci a paměť. Implementace může používat brute force, stromové indexy, grafové struktury, kvantizaci nebo kombinované filtry. Top k je definované vůči konkrétnímu indexu, metrice a verzi vektorovej reprezentace.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při otázce uživatele se vytvoří embedding a systém potřebuje najít peť najpodobnejších dokumentových úseků. Samotné vyhledávání ještě nic neklasifikuje a negeneruje, pouze vrátí kandidátů podle geometrie indexu. Při miliónoch vektorů by porovnání se všemi bylo pomalé, proto index preskakuje večšinu prostoru. Pokud je nastavený příliš agresívne, nejlepší úsek se nemusí dostat mezi výsledky, ačkoli odpoveďový model funguje správně. Retrieval tím proto měří zvlášť kvalitu embeddingu, indexu, filtrů a finálneho pořadí.

Časté otázky

Časté otázky

Jaký je rozdíl mezi presným a aproximovaným vyhledáváním?

Přesné prehladávání garantuje top k podle metriky, ale může být drahé. Approximate nearest neighbor index zrýchluje dotaz a šetří zdroje výmenou za možnost, že některý skutečný soused nebude vrátený.

Co znamená recall@k při susedskom vyhledávání?

Porovnává, kolik skutečných top k sousedů z presného výpočtu našla aproximovaná metoda. Měří kvalitu indexu, ne relevanci pro uživatele, proto se má doplnit aplikačnou retrieval metrikou.

Kdy jsou KD-tree a Balltree účinné?

Při nižšej nebo střední dimenzionalite a vhodné metrice dokážu vylúčit velké části prostoru. Ve velmi vysokých dimenziách se jejich výhoda často ztrácí a používají se grafové nebo kvantizačné ANN indexy.

Jako filtry mění vyhledávání?

Podmínka na jazyk, oprávnění, datum nebo typ dokumentu omezí prípustných kandidátů. Filtr může proběhnout před vektorovým dotazom, po ňom nebo integrovane, přičemž každá strategie mění latenci i recall.

Proč se musí verzovat embeddingový model spolu s indexem?

Vektory z různých modelů nebo verzií nemusí zdielat stejný prostor. Po změně embeddingu je třeba kolekci prepočítat nebo oddělit indexy, jinak podobnostné skóre ztratí interpretaci.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • scikit-learn, Nearest Neighbors
  • scikit-learn, NearestNeighbors

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.