【问题标题】:What are the steps of preprocessing anonymized data for predictive analysis?预处理匿名数据以进行预测分析的步骤是什么?
【发布时间】:2015-09-29 02:00:09
【问题描述】:

假设我们有一个匿名数据的大型数据集。数据集由一定数量的变量和观察组成。我们所能了解的所有数据都是变量的类型(数字、字符、日期等)。我们可以通过手动查看数据来做到这一点。 预处理数据集以进行进一步分析的最佳实践步骤是什么?

例如,让这个数据集只是一个表,所以我们不需要检查表之间的任何关系。

【问题讨论】:

    标签: data-mining


    【解决方案1】:

    This link 提供了当前实践中的完整验证集。不过,首先:

    • 尽可能使用您首选的编程语言的方法/构造函数以尽可能快速和轻松地解析数据的方式编写数据;
    • 您可以验证所有数据类型是否正确匹配 - 例如 int 字段不包含字符串数据等;
    • 您可以验证您的值是否在可接受的范围内;
    • 检查不可为空的字段是否有空值;
    • 检查日期是否在预期范围内;
    • 检查数据是否遵循正确的set-membership约束(如果适用);
    • 如果您有像电话号码这样的模式跟随数据,请确保它们采用 (XXX) XXX-XXXX 设计,如果您喜欢这样的话;
    • 是正确准确度级别的邮政编码(在美国,您可能有 5 或 9 位准确度);
    • 如果你的数据是时间序列的,它是否完整(即你有所有日期的值)?
    • 是否有任何不需要的重复?

    希望这足以让你开始......

    【讨论】:

    • 可能我需要更新问题,以便澄清。请查看更新。
    • @angubenko:我看不到你的问题有任何更新。
    • 对不起,我正在输入它
    • @angubenko:这是一个您可能会觉得有用的链接:coursera.org/course/…
    • @angubenko:乐于助人。 :)
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-04-28
    • 2021-07-15
    • 2017-11-03
    • 1970-01-01
    相关资源
    最近更新 更多