【问题标题】:Data selecting in data science project about predicting house prices数据科学项目中关于预测房价的数据选择
【发布时间】:2021-07-26 17:15:54
【问题描述】:

这是我的第一个数据科学项目,我需要选择一些数据。当然,我知道我不能只选择所有可用的数据,因为这会导致过度拟合。我目前正在调查丹麦首都过去 10 年的房价,我想知道我应该在数据中选择哪种类型的房屋:

  1. 自住公寓和房屋(这提供了一个包含 50000 个元素的数据集)
  2. 或者只是自住公寓(这提供了一个包含 43000 个元素的数据集)

如您所见,丹麦首都出售的自住公寓要多得多。我的意见是我应该只选择自住公寓,因为这样我的数据中就有“相同”类型的元素,而且仍然有 43000 个元素。

此外,如果您拥有房屋而不是拥有自住公寓,则涉及的税款要高得多。这可能会影响房子的价格并使数据稍微偏斜。

我看到一些项目同时选择了自住公寓和房屋作为数据,结论是过度拟合,所以这是我希望避免的。

【问题讨论】:

    标签: data-science prediction


    【解决方案1】:

    这是一个典型的因缺乏数据或数据不足而导致过度拟合的例子。

    让我举例说明解决此类问题的选择过程。我将以信用卡欺诈为例,然后将其与您的问题或任何未来的分类数据预测问题联系起来。

    在理想世界中,信用卡欺诈并不常见。因此,如果您查看真实数据,您会发现只有 2% 的数据导致欺诈。因此,如果您使用此数据集训练模型,则会出现偏差,因为您没有该类的正态分布(即,在您的业主自住公寓和房屋的情况下,欺诈和无欺诈交易)。有4 种方法可以解决此问题

    假设数据集有 90 个无欺诈数据点和 10 个欺诈数据点。

    1.在抽样多数类下


    在此我们仅从 90 个数据点中选择 10 个数据点,并以 10:10 的比例训练模型,因此分布是标准化的(在您的情况下,仅使用 43000 个单位中的 7000 个)。这不是理想的方式,因为我们会处理大量数据。

    2.通过重复抽样少数类


    在此我们复制 10 个数据点以使其 90 个数据点分布标准化(在您的情况下,复制 7000 个房屋数据以使其 43000 即等于公寓的数据)。虽然这项工作有更好的方法。


    Synthetic Minority Over-sampling Technique 是一种技术,我们使用 k 最近邻算法在您的情况下生成少数类别的住房数据。有一个名为不平衡学习 (here) 的模块可用于实现这一点。

    4.集成方法


    在这种方法中,您将数据分成多个数据集以使其平衡,例如将 90 个数据集分成 9 个集合,这样每个集合可以有 10 个欺诈类数据和 10 个非欺诈类数据。在你的情况下,在 7000 批中潜水 43000。之后分别训练每个并使用多数投票机制进行预测。

    【讨论】:

    • 非常感谢您的深入回答。我想知道这些方法在现实生活中有多好?这样做是数据科学界的普遍做法吗?我应该在特征选择之后在 og 之前执行此操作吗?
    • SMOTE 是唯一推荐的方法,它是解决此问题的标准做法。这应该在特征处理之前,因为数据可能会影响您的特征。
    • @restingquartH 我无法对最后一个答案发表评论,所以在这里询问这个分布是关于预测价格还是默认数据集?
    • 图表是默认数据集。它显示了过去 30 年的房价和自住单位价格。如果您查看图表,2006 年和 2018 年的两个价格之间最多存在 12% 的偏差。这个偏差是否足以说数据是有偏差/数据不足的?
    【解决方案2】:

    所以现在我创建了下图。绿线显示自住公寓的每平方米价格,红线显示房屋每平方米的价格(所有价格均为丹麦克朗)。我想知道是否存在不平衡分类?价格的最大偏差最多为 10%(例如,参见 2018 年)。 10% 是否足以说明数据有偏差,因此分类不平衡?

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2019-10-12
      • 2016-05-06
      • 2012-12-05
      • 2019-11-13
      • 1970-01-01
      • 2021-06-03
      • 1970-01-01
      相关资源
      最近更新 更多