【发布时间】:2010-05-10 18:46:55
【问题描述】:
此问题与Tools for matching name/address data 有关。 SAS、Oracle、Microsoft 等提供了许多商业工具,允许对来自多个来源的个人或公司的名称进行重复删除或合并。
但是,在阅读了前面提到的问题的答案后,我想知道为什么一个看似有趣的问题没有收到任何提到可以解决该问题的开源项目的答案。
您是否知道任何开源项目或算法来实现所谓的“记录链接”、“记录合并”或“集群”?
【问题讨论】:
-
@luis:一分钱一分货。
-
约翰,在这种特殊情况下,它可能是真的(这就是我想要找出的)。但是,总的来说,我不得不不同意。毕竟,生活中最好的东西不是免费的吗?即,阳光、空气等? 20 年前,谁会梦想拥有一款功能强大且无需任何成本的操作系统?
-
@luis:它可能不会花费你任何东西,但它会花费某人一些东西。
-
试试applyalgo.com的DataExplorer,支持不精确的记录匹配。虽然从左侧和右侧链接数据的键必须准确,但数据资源管理器允许用户在尝试确定左侧的一个单元格与右侧的相应单元格“不同”时指定不精确的字段标准/阈值。对于数值,它是简单的 % 数值差异。对于字符串,他们在后面运行某种模糊的字符串相似性度量。
标签: data-quality