【问题标题】:Records deduplication(linkage) algorithms [closed]记录重复数据删除(链接)算法[关闭]
【发布时间】:2017-01-20 17:07:22
【问题描述】:

我有一个标准的记录重复数据删除任务: 我有很多带有一些文本(或其他)字段的记录,其中一些对应于同一个实体。合并这些记录是任务的目标。

这类任务有一些广泛使用且简单的统计方法 比如“Probabilistic Record Linkage”。其中一些更精确,更复杂,但利用了相同的想法,如https://github.com/datamade/dedupe: 他们尝试以某种方式对每个字段进行加权作为相似性的度量,然后将加权差异的线性组合作为整个记录相似性的度量。

但对于某些任务,我有很多未知字段,但类似字段的数量相当大,例如:

record1 : propA = A ; propB = unknown ; propC = unknown ;  ....
record2 : propA = A ; propB = B ; propC = unknown ; ....
record3 : propA = unkown ; propB = B ; propC = D ; ....

record4 : propA = A2 ; propB = unknown ; propC = unknown ;  ....
record5 : propA = A2 ; propB = B2 ; propC = unknown ; ....
record6 : propA = X2 ; propB = B2 ; propC = D2 ; ....

在这种情况下,记录 1 更可能通过记录 2 与记录 3 链接,因为 记录 4 和记录 6。

这意味着我需要一些与图聚类类似的东西,但有很多跳过和非常大量的节点和边。 我不需要精确的解决方案,但必须存在更好的经典统计重复数据删除。

【问题讨论】:

    标签: algorithm graph duplicates cluster-analysis record-linkage


    【解决方案1】:

    Dedupe 处理丢失的数据并进行图聚类。记录链接还有其他范例,但您的数据似乎不需要它。

    如果您想研究较新的范式,请查看 Beka Steorts 或 Michael Wick 的工作。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-04-11
      • 2010-11-04
      • 2022-07-20
      • 2013-02-23
      • 2018-03-14
      • 1970-01-01
      相关资源
      最近更新 更多