Retrieval a datová infrastruktura

vektorová databáze

Vector database je databázový systém navržený na ukladání, indexování, filtrování a vyhledávání vysokodimenzionálnych vektorů, často spolu s identifikátorom, metadátami a původným objektem. Podporuje podobnostné metriky, přibližné nearest-neighbor indexy, aktualizace, škálování a provozní vlastnosti jako replikace či řízení přístupu. Ne každé úložiště vektorů je plnohodnotná databáze. Kvalitu řešení určuje konzistence embeddingů, recall indexu, filtrace, latence, čerstvost dat a auditovatelné propojení na zdroj.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-07

Odborná definice

Odborná definice

Vector database je databázový systém navržený na ukladání, indexování, filtrování a vyhledávání vysokodimenzionálnych vektorů, často spolu s identifikátorom, metadátami a původným objektem. Podporuje podobnostné metriky, přibližné nearest-neighbor indexy, aktualizace, škálování a provozní vlastnosti jako replikace či řízení přístupu. Ne každé úložiště vektorů je plnohodnotná databáze. Kvalitu řešení určuje konzistence embeddingů, recall indexu, filtrace, latence, čerstvost dat a auditovatelné propojení na zdroj.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Vektorová databáze je katalóg, ve kterém položky nejsou zoradené pouze podle názvu nebo čísla, ale i podle významové polohy. Dokument, obrázek či produkt se premení na vektor a uloží spolu s metadátami. Při otázce se vytvoří nový vektor a systém najde nejbližších sousedů, například pasáže podobné záměru uživatele. Databáze však nerieši vše sama. Pokud je embedding slabý, dokumenty špatně rozdělené nebo filtry nesprávně, rychlý index pouze efektivně vrátí nevhodné výsledky.

Časté otázky

Časté otázky

Je vektorová databáze potřebná pro každý RAG systém?

Ne. Při malém korpuse může stačit lokální index nebo relační databáze s vektorovým rozšírením. Samostatný systém má smysl při rozsahu, aktualizacích a provozních nárokoch.

Co se ukládá vedla embeddingu?

Typicky identifikátor, textový chunk, zdroj, čas, jazyk, oprávnění a filtry. Metadata umožňují vysvetlit výsledek a omezit retrieval na povolený obsah.

Jak se řeší změna embeddingového modelu?

Vektory z různých modelů nemusí být srovnatelné. Migrace obvykle vyžaduje nové embeddingy, paralelní index, test recallu a kontrolovaný prechod.

Je podobnostné vyhledávání transakčne konzistentní?

Závisí na produktu a indexu. Některé systémy aktualizují ANN strukturu asynchrónne, takže nový záznam nemusí být okamžitě dostupný ve všech replikách.

Jaké bezpečnostní riziko prinášají metadata?

Mohou obsahovat citlivý text, identitu nebo přístupové pravidla. Retrieval musí presadzovat autorizaci před vrátením obsahu, ne až po vytvoření odpovědi.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google Cloud, Introduction to Vector Search PostgreSQL pgvector documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.