Data a kvalita

Datová deduplikace

Datová deduplikace je identifikace a řízené odstranění nebo zoskupení záznamů, které představují ten jistý objekt, událost nebo obsah. Nejde pouze o přesně zhodné soubory, ale i o blízké kopie, preformátované dokumenty, opakované fotografie, parafráze či záznamy jedné entity s odlišným identifikátorom. V AI deduplikace omezuje prevažování často opakovaného obsahu, memorování, datový únik mezi rozdeleniami a skreslené metriky. Musí zachovat legitimní opakování, které nesou informaci o frekvencii.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-24

Odborná definice

Odborná definice

Datová deduplikace je identifikace a řízené odstranění nebo zoskupení záznamů, které představují ten jistý objekt, událost nebo obsah. Nejde pouze o přesně zhodné soubory, ale i o blízké kopie, preformátované dokumenty, opakované fotografie, parafráze či záznamy jedné entity s odlišným identifikátorom. V AI deduplikace omezuje prevažování často opakovaného obsahu, memorování, datový únik mezi rozdeleniami a skreslené metriky. Musí zachovat legitimní opakování, které nesou informaci o frekvencii.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud se jedna webová stránka nachází v tréninkovém korpuse stokrát přes archívy a partnerské kopie, model její venuje neprimeranou váhu. Pokud se podobná kópia objeví i v teste, výsledek může měřit zapametání. Deduplikace hledá přesné i přibližné shody a rozhoduje, či jde o stejný obsah nebo o samostatný případ. Při transakciách však opakovaný nákup nemusí být duplicita, ale důležitý signál. Proto se pravidlo deduplikace vždy váže na význam entity, čas a účel datasetu.

Časté otázky

Časté otázky

Jaký je rozdíl mezi presnou a približnou deduplikací?

Přesná porovnává identické bajty nebo normalizovaný obsah. Približná používá podobnost, hashe, embeddingy nebo entity resolution na blízké kopie.

Proč je deduplikace důležitá pro jazykové modely?

Snižuje memorování opakovaného textu, neprimerané vážení populárnych dokumentů a prenikání benchmarků či jejich řešení do tréninkového korpusu.

Může odstranění duplicít poškodit distribuci?

Ano. Pokud frekvence opakování představuje reálnou pravděpodobnost nebo chování, úplné odstranění změní cílové rozdělení.

Jak se hladají podobné obrázky?

Používají se perceptuálne hashe, lokálně deskriptory nebo embeddingy. Práh podobnosti se ověřuje na vzorku, aby se nezlúčili odlišné případy.

Co je entity resolution?

Proces spájání záznamů, které označují tu jistou reálnou entitu navzdory odlišným menám, adresám, identifikátorom nebo chybám v zápise.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.