Reprezentácie a retrieval

Embedding model

Model vektorových reprezentácií

Embedding model je model, ktorý mapuje vstupný objekt do vektora navrhnutého tak, aby vzdialenosť alebo podobnosť medzi vektormi podporovala konkrétnu úlohu. Často sa trénuje kontrastívnym učením, párovým rankingom alebo viacúčelovým cieľom, ktorý približuje relevantné dvojice a oddeľuje nerelevantné. Model môže byť unimodálny alebo multimodálny, bi-encoder alebo súčasť väčšej architektúry. Pri výbere rozhoduje jazyk, doména, maximálna dĺžka, dimenzia, licencia, latencia a meraná retrieval kvalita.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-E-06

Odborná definícia

Odborná definícia

Embedding model je model, ktorý mapuje vstupný objekt do vektora navrhnutého tak, aby vzdialenosť alebo podobnosť medzi vektormi podporovala konkrétnu úlohu. Často sa trénuje kontrastívnym učením, párovým rankingom alebo viacúčelovým cieľom, ktorý približuje relevantné dvojice a oddeľuje nerelevantné. Model môže byť unimodálny alebo multimodálny, bi-encoder alebo súčasť väčšej architektúry. Pri výbere rozhoduje jazyk, doména, maximálna dĺžka, dimenzia, licencia, latencia a meraná retrieval kvalita.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Embedding model je prekladač medzi obsahom a vektorovou databázou. Ak má systém vyhľadávať podobné servisné prípady, model musí rozumne umiestniť blízko seba zápisy s rovnakou poruchou, aj keď technici použili odlišné formulácie. Model určený na všeobecné webové texty môže prehliadať kódy súčiastok alebo odborné skratky. Preto sa nevyberá podľa veľkosti názvu, ale podľa testu na vlastných dotazoch, rýchlosti, ceny indexácie a stability verzie počas prevádzky. Výmena modelu je preto aj migračný projekt, nie iba zmena API.

Časté otázky

Časté otázky

Čo je bi-encoder pri embeddingoch?

Dotaz a dokument kóduje oddelene, takže dokumentové vektory možno uložiť vopred. Vyhľadávanie je rýchle, hoci interakcia medzi dvojicou je menej detailná než pri cross-encodéri.

Kedy sa oplatí doménový fine tuning?

Keď všeobecný model nerozlišuje odborné významy, špecifické typy relevancie alebo lokálny jazyk. Potrebné sú kvalitné pozitívne a negatívne páry.

Je vyššia dimenzia vždy lepšia?

Nie. Môže zachytiť viac informácií, ale zvyšuje pamäť, prenos a náklady vyhľadávania. Rozhoduje výsledok na úlohe, nie samotný počet súradníc.

Ako sa tvoria hard negatives?

Sú to zdanlivo podobné, ale nesprávne dokumenty. Získavajú sa z výsledkov existujúceho retrievera, pravidiel alebo odborného označovania a zlepšujú rozlišovanie.

Môže sa model aktualizovať bez preindexovania?

Iba ak poskytovateľ garantuje kompatibilný priestor, čo nebýva bežné. Bez overenia sa má nová verzia považovať za nekompatibilnú a korpus znovu zakódovať.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.