Odborná definice
Odborná definice
Datová deduplikace je identifikace a řízené odstranění nebo zoskupení záznamů, které představují ten jistý objekt, událost nebo obsah. Nejde pouze o přesně zhodné soubory, ale i o blízké kopie, preformátované dokumenty, opakované fotografie, parafráze či záznamy jedné entity s odlišným identifikátorom. V AI deduplikace omezuje prevažování často opakovaného obsahu, memorování, datový únik mezi rozdeleniami a skreslené metriky. Musí zachovat legitimní opakování, které nesou informaci o frekvencii.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Pokud se jedna webová stránka nachází v tréninkovém korpuse stokrát přes archívy a partnerské kopie, model její venuje neprimeranou váhu. Pokud se podobná kópia objeví i v teste, výsledek může měřit zapametání. Deduplikace hledá přesné i přibližné shody a rozhoduje, či jde o stejný obsah nebo o samostatný případ. Při transakciách však opakovaný nákup nemusí být duplicita, ale důležitý signál. Proto se pravidlo deduplikace vždy váže na význam entity, čas a účel datasetu.
Časté otázky
Časté otázky
Jaký je rozdíl mezi presnou a približnou deduplikací?
Přesná porovnává identické bajty nebo normalizovaný obsah. Približná používá podobnost, hashe, embeddingy nebo entity resolution na blízké kopie.
Proč je deduplikace důležitá pro jazykové modely?
Snižuje memorování opakovaného textu, neprimerané vážení populárnych dokumentů a prenikání benchmarků či jejich řešení do tréninkového korpusu.
Může odstranění duplicít poškodit distribuci?
Ano. Pokud frekvence opakování představuje reálnou pravděpodobnost nebo chování, úplné odstranění změní cílové rozdělení.
Jak se hladají podobné obrázky?
Používají se perceptuálne hashe, lokálně deskriptory nebo embeddingy. Práh podobnosti se ověřuje na vzorku, aby se nezlúčili odlišné případy.
Co je entity resolution?
Proces spájání záznamů, které označují tu jistou reálnou entitu navzdory odlišným menám, adresám, identifikátorom nebo chybám v zápise.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Google Research, Deduplicating Training Data Makes Language Models Better
- NIST Entity Resolution resources
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
