Dáta pre AI

deduplikácia dát

Anglický výraz data deduplication

pokročiléheslo č. 9355 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená deduplikácia dát?

Deduplikácia dát vyhľadáva a odstraňuje alebo zoskupuje záznamy predstavujúce tú istú obsahovú jednotku. Môže používať presný hash, normalizovaný kľúč alebo podobnosť reprezentácií; pravidlo musí zachovať kanonický záznam a väzby na jeho výskyty.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Korpus článkov najprv zoskupí presné kópie podľa normalizovaného hashu a potom syndikované verzie podľa textovej podobnosti. Skupina, nie jednotlivý súbor, sa priradí do jednej časti datasetu.

Overiteľnosť

Odborné zdroje

  1. Abbas et al. - SemDeDup: Data-efficient learning at web-scalearxiv.org
  2. Barz & Denzler - Training on Test Data: Removing Near Duplicates in Fashion-MNISTarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje deduplikácia dát?

Systém vytvorí podpisy, vyhľadá zhodné alebo podobné páry a podľa prahu ich spojí do klastrov.

Kedy má deduplikácia dát praktický význam?

Korpus článkov najprv zoskupí presné kópie podľa normalizovaného hashu a potom syndikované verzie podľa textovej podobnosti.

S čím si pojem nezamieňať?

Deduplikácia rieši rovnaký obsah; integrácia dát môže zlúčiť rôzne záznamy o tej istej entite.

Ako sa výsledok kontroluje?

Kontroluje sa presnosť párov nad a pod prahom, veľkosť klastrov, strata unikátov a výskyt jednej skupiny naprieč časťami.

Na čo si dať pozor?

Príliš prísny prah ponechá úniky, príliš voľný odstráni legitímne podobné menšinové prípady.