Dáta pre AI

detekcia takmer duplikátov

Anglický výraz near-duplicate detection

pokročiléheslo č. 9365 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená detekcia takmer duplikátov?

Detekcia takmer duplikátov hľadá obsahovo veľmi podobné záznamy, ktoré sa líšia o orezanie, prepis, kompresiu, šablónu alebo malú úpravu. Na rozdiel od presného hashu používa perceptuálne, tokenové či embeddingové podpisy a doménovo kalibrovaný prah.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pri obrazovom teste sa perceptuálnym hashom a embeddingom nájdu orezané a prekomprimované verzie tréningových snímok. Podozrivé páry sa ručne overia a celá skupina sa presunie do jednej časti.

Overiteľnosť

Odborné zdroje

  1. Barz & Denzler - Training on Test Data: Removing Near Duplicates in Fashion-MNISTarxiv.org
  2. Abbas et al. - SemDeDup: Data-efficient learning at web-scalearxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje detekcia takmer duplikátov?

Približný index vyhľadá susedov v priestore podpisov a prah podobnosti vytvorí kandidátne páry alebo klastre.

Kedy má detekcia takmer duplikátov praktický význam?

Pri obrazovom teste sa perceptuálnym hashom a embeddingom nájdu orezané a prekomprimované verzie tréningových snímok.

S čím si pojem nezamieňať?

Presný duplikát má identický normalizovaný obsah; takmer duplikát zachováva podstatný obsah napriek malej zmene.

Ako sa výsledok kontroluje?

Vzorkujú sa páry pri hranici prahu, meria presnosť a úplnosť, kontrolujú klastre a vplyv na testovacie skóre.

Na čo si dať pozor?

Globálny prah nemusí fungovať pre krátky text, fotografie aj šablónové dokumenty rovnako.