【发布时间】:2017-01-20 17:07:22
【问题描述】:
我有一个标准的记录重复数据删除任务: 我有很多带有一些文本(或其他)字段的记录,其中一些对应于同一个实体。合并这些记录是任务的目标。
这类任务有一些广泛使用且简单的统计方法 比如“Probabilistic Record Linkage”。其中一些更精确,更复杂,但利用了相同的想法,如https://github.com/datamade/dedupe: 他们尝试以某种方式对每个字段进行加权作为相似性的度量,然后将加权差异的线性组合作为整个记录相似性的度量。
但对于某些任务,我有很多未知字段,但类似字段的数量相当大,例如:
record1 : propA = A ; propB = unknown ; propC = unknown ; ....
record2 : propA = A ; propB = B ; propC = unknown ; ....
record3 : propA = unkown ; propB = B ; propC = D ; ....
record4 : propA = A2 ; propB = unknown ; propC = unknown ; ....
record5 : propA = A2 ; propB = B2 ; propC = unknown ; ....
record6 : propA = X2 ; propB = B2 ; propC = D2 ; ....
在这种情况下,记录 1 更可能通过记录 2 与记录 3 链接,因为 记录 4 和记录 6。
这意味着我需要一些与图聚类类似的东西,但有很多跳过和非常大量的节点和边。 我不需要精确的解决方案,但必须存在更好的经典统计重复数据删除。
【问题讨论】:
标签: algorithm graph duplicates cluster-analysis record-linkage