【问题标题】:Are there free, low cost, or open source tools for matching name/address data? [closed]是否有用于匹配姓名/地址数据的免费、低成本或开源工具? [关闭]
【发布时间】:2010-05-10 18:46:55
【问题描述】:

此问题与Tools for matching name/address data 有关。 SAS、Oracle、Microsoft 等提供了许多商业工具,允许对来自多个来源的个人或公司的名称进行重复删除或合并。

但是,在阅读了前面提到的问题的答案后,我想知道为什么一个看似有趣的问题没有收到任何提到可以解决该问题的开源项目的答案。

您是否知道任何开源项目或算法来实现所谓的“记录链接”、“记录合并”或“集群”?

【问题讨论】:

  • @luis:一分钱一分货。
  • 约翰,在这种特殊情况下,它可能是真的(这就是我想要找出的)。但是,总的来说,我不得不不同意。毕竟,生活中最好的东西不是免费的吗?即,阳光、空气等? 20 年前,谁会梦想拥有一款功能强大且无需任何成本的操作系统?
  • @luis:它可能不会花费任何东西,但它会花费某人一些东西。
  • 试试applyalgo.com的DataExplorer,支持不精确的记录匹配。虽然从左侧和右侧链接数据的键必须准确,但数据资源管理器允许用户在尝试确定左侧的一个单元格与右侧的相应单元格“不同”时指定不精确的字段标准/阈值。对于数值,它是简单的 % 数值差异。对于字符串,他们在后面运行某种模糊的字符串相似性度量。

标签: data-quality


【解决方案1】:

我建议将 Google Refine 作为开源 (New BSD license) 工具来解析和修复粗糙数据。它还允许对重复数据进行聚类和协调,并具有数据挖掘功能。

我用它成功地导入和修复了各种格式的数据,.csv、.tsv、.xls、.xml、.json、.rdf 等。它可以在内部使用而无需向外部发送任何数据,这似乎是问题"tools for matching name/address data"

所关心的问题

注意。 Google Refine 以前称为 Freebase Gridworks。

【讨论】:

    【解决方案2】:

    我偶然发现了以下文章:“Merge/Purge and Duplicate Detection”。

    通过查看http://www.semaphorecorp.com,我发现了一些极低的价格。

    这不是我要找的,但至少是一点帮助,是朝着正确方向迈出的一步。

    【讨论】:

      【解决方案3】:

      在 sourceforge 上试用 OSDQ 开源数据质量和分析项目

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2013-11-06
        • 2012-03-10
        • 1970-01-01
        • 1970-01-01
        • 2011-02-14
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多