Dáta a kvalita

Dátová deduplikácia

Data deduplication

Dátová deduplikácia je identifikácia a riadené odstránenie alebo zoskupenie záznamov, ktoré predstavujú ten istý objekt, udalosť alebo obsah. Nejde iba o presne zhodné súbory, ale aj o blízke kópie, preformátované dokumenty, opakované fotografie, parafrázy či záznamy jednej entity s odlišným identifikátorom. V AI deduplikácia obmedzuje prevažovanie často opakovaného obsahu, memorovanie, dátový únik medzi rozdeleniami a skreslené metriky. Musí zachovať legitímne opakovania, ktoré nesú informáciu o frekvencii.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-24

Odborná definícia

Odborná definícia

Dátová deduplikácia je identifikácia a riadené odstránenie alebo zoskupenie záznamov, ktoré predstavujú ten istý objekt, udalosť alebo obsah. Nejde iba o presne zhodné súbory, ale aj o blízke kópie, preformátované dokumenty, opakované fotografie, parafrázy či záznamy jednej entity s odlišným identifikátorom. V AI deduplikácia obmedzuje prevažovanie často opakovaného obsahu, memorovanie, dátový únik medzi rozdeleniami a skreslené metriky. Musí zachovať legitímne opakovania, ktoré nesú informáciu o frekvencii.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Ak sa jedna webová stránka nachádza v tréningovom korpuse stokrát cez archívy a partnerské kópie, model jej venuje neprimeranú váhu. Ak sa podobná kópia objaví aj v teste, výsledok môže merať zapamätanie. Deduplikácia hľadá presné aj približné zhody a rozhoduje, či ide o rovnaký obsah alebo o samostatný prípad. Pri transakciách však opakovaný nákup nemusí byť duplicita, ale dôležitý signál. Preto sa pravidlo deduplikácie vždy viaže na význam entity, čas a účel datasetu.

Časté otázky

Časté otázky

Aký je rozdiel medzi presnou a približnou deduplikáciou?

Presná porovnáva identické bajty alebo normalizovaný obsah. Približná používa podobnosť, hashe, embeddingy alebo entity resolution na blízke kópie.

Prečo je deduplikácia dôležitá pre jazykové modely?

Znižuje memorovanie opakovaného textu, neprimerané váženie populárnych dokumentov a prenikanie benchmarkov či ich riešení do tréningového korpusu.

Môže odstránenie duplicít poškodiť distribúciu?

Áno. Ak frekvencia opakovania predstavuje reálnu pravdepodobnosť alebo správanie, úplné odstránenie zmení cieľové rozdelenie.

Ako sa hľadajú podobné obrázky?

Používajú sa perceptuálne hashe, lokálne deskriptory alebo embeddingy. Prah podobnosti sa overuje na vzorke, aby sa nezlúčili odlišné prípady.

Čo je entity resolution?

Proces spájania záznamov, ktoré označujú tú istú reálnu entitu napriek odlišným menám, adresám, identifikátorom alebo chybám v zápise.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.