【问题标题】:Google Refine - pull out identical values in cellGoogle Refine - 在单元格中提取相同的值
【发布时间】:2015-10-11 01:41:09
【问题描述】:

我的列中有这样的数据

["Lymore Cottages", "Lymore Cottages", "Lymore Cottages", "Lymore Cottages", "Lymore Cottages", "Lymor Cottages"]

它本质上是同一件事多次,但由于这些是由用户输入的,它们可能会有所不同。如果您注意到最后一个缺少 e。

我想做的是创建一个新列,其中只有唯一的名称。因此,新列将只包含“Lymore Cottages, Lymor Cottages”。

我相信这可以通过 Google/open Refine 实现。我尝试了聚类,但这也将所有其他行聚类到具有相同细节而不是每个单元格。 (无论是否有其他 20 行具有相同数据,我都需要每行)

【问题讨论】:

    标签: data-manipulation openrefine


    【解决方案1】:

    这不是一个编程问题,但是在单元格中拆分值 removing the duplicates 然后重新组装内容可能会起作用。

    可能有一种更简单的方法可以做到这一点。大致可以

    拆分

    1. Split multi-valued cells...在专栏

    2. 去掉括号和引号

      value.replace('[', '').replace(']','').replace('"', '')

    删除重复项

    1. 接下来,Sort... A-Z 和 Reorder rows permanently

    2. Blank down在专栏

    3. 调用Facet by blank并选择True

    4. Remove all matching rows 来自All > Edit rows

    重新组装

    1. 在专栏,Transpose cells in rows into columns...

    2. 使用括号和引号重建字段

      '['+ ' ' + value + ',' + ' ' + cells['Step 7 Field Name'].value + ' ' + ']'

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2020-09-09
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-04-08
      • 2020-06-06
      相关资源
      最近更新 更多