Dáta a reprezentácie · Dáta a kvalita

Data deduplication

Dátová deduplikácia

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-24

Odborná definícia

Význam a odborné vymedzenie pojmu

Dátová deduplikácia je identifikácia a riadené odstránenie alebo zoskupenie záznamov, ktoré predstavujú ten istý objekt, udalosť alebo obsah. Nejde iba o presne zhodné súbory, ale aj o blízke kópie, preformátované dokumenty, opakované fotografie, parafrázy či záznamy jednej entity s odlišným identifikátorom. V AI deduplikácia obmedzuje prevažovanie často opakovaného obsahu, memorovanie, dátový únik medzi rozdeleniami a skreslené metriky. Musí zachovať legitímne opakovania, ktoré nesú informáciu o frekvencii.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Ak sa jedna webová stránka nachádza v tréningovom korpuse stokrát cez archívy a partnerské kópie, model jej venuje neprimeranú váhu. Ak sa podobná kópia objaví aj v teste, výsledok môže merať zapamätanie. Deduplikácia hľadá presné aj približné zhody a rozhoduje, či ide o rovnaký obsah alebo o samostatný prípad. Pri transakciách však opakovaný nákup nemusí byť duplicita, ale dôležitý signál. Preto sa pravidlo deduplikácie vždy viaže na význam entity, čas a účel datasetu.

Časté otázky

Otázky, ktoré spresňujú význam

Aký je rozdiel medzi presnou a približnou deduplikáciou?

Presná porovnáva identické bajty alebo normalizovaný obsah. Približná používa podobnosť, hashe, embeddingy alebo entity resolution na blízke kópie.

Prečo je deduplikácia dôležitá pre jazykové modely?

Znižuje memorovanie opakovaného textu, neprimerané váženie populárnych dokumentov a prenikanie benchmarkov či ich riešení do tréningového korpusu.

Môže odstránenie duplicít poškodiť distribúciu?

Áno. Ak frekvencia opakovania predstavuje reálnu pravdepodobnosť alebo správanie, úplné odstránenie zmení cieľové rozdelenie.

Ako sa hľadajú podobné obrázky?

Používajú sa perceptuálne hashe, lokálne deskriptory alebo embeddingy. Prah podobnosti sa overuje na vzorke, aby sa nezlúčili odlišné prípady.

Čo je entity resolution?

Proces spájania záznamov, ktoré označujú tú istú reálnu entitu napriek odlišným menám, adresám, identifikátorom alebo chybám v zápise.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.