【问题标题】:How to use anonymized datasets?如何使用匿名数据集?
【发布时间】:2013-05-18 01:47:40
【问题描述】:

我在关联规则方面迈出了第一步。

我找到了这个话题 (Supermarket dataset for Apriori algorithm)。 然后我尝试使用answer2中建议的数据,但是当我看到数据集的解释时,似乎与实际数据没有任何关联。

关于数据集,作者解释说:“数据集中的每条记录都包含购买日期(变量‘date’)、收据编号(变量‘receipt nr’)的信息……”

在我看到的数据的第一条记录中:

0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29

第二个:

30 31 32

我想这是因为数据集已经“匿名化”了,但是我应该如何将变量“翻译”成数据呢?

【问题讨论】:

    标签: data-mining


    【解决方案1】:

    快速浏览一下,我假设这只是原始数据的一个子集,采用典型的“篮子”格式。 每一行都是一笔交易,每一个数字都是一件物品。

    不,如果没有其他数据源,您将无法分辨这些是哪些项目。

    因此,测试您的算法在真实数据上返回 something 非常有用,但您不会真正知道它发现了什么

    您可能想查看 IIRC 与 Weka 一起提供的 supermarket.arff 文件。它至少标有一些产品类别(例如“冷冻食品”)。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-08-16
      • 2020-11-25
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多