【问题标题】:ML enough features?ML 有足够的功能吗?
【发布时间】:2015-07-21 21:58:18
【问题描述】:

我正在尝试在加速度计数据集上训练一个随机森林。我计算平均值、标准差、轴之间的相关性、曲线下面积等特征。我是 ML Noob。

我试图理解两件事:

1.如果我将数据集从一个人拆分为测试并训练并运行 RF 预测,则准确度很高(> 90%)。但是,如果我用来自不同人的数据训练 RF,然后进行预测,则准确度很低(

  1. 在上面的例子中,要达到 90% 的准确率,有多少特征是“足够”的?多少数据才算“足够”?

我可以提供更多细节。数据集来自 10 个人,标记数据的大文件。我将自己限制在上述功能上,以避免大量计算。

【问题讨论】:

    标签: machine-learning accelerometer


    【解决方案1】:
    1. 很可能你的分类器过拟合了,当你只在一个人身上训练它时,它不能很好地泛化,它可能只是简单地“记忆”带有标签的数据集,而不是捕捉一般的分布规则:每个特征如何与其他特征相关/如何它们会影响结果/等。也许您需要更多数据或更多功能。

    2. 不是那么简单的问题,是泛化问题,这方面的理论研究很多,例如:Vapnik–Chervonenkis theory Akaike_information_criterion。即使了解这些理论,您也无法准确回答这个问题。大多数此类理论的主要原则——你拥有的数据越多,你试图拟合的变量模型越少,你需要的训练和测试的准确性之间的差异越小——这些理论将使你的模型排名更高。例如,如果您不想最小化测试集和训练集的准确性之间的差异(以确保测试数据的准确性不会崩溃) - 您需要增加数据量,提供更有意义的特征(相对于您的模型),或使用较少变化的模型进行拟合。如果您对理论方面的更详细解释感兴趣,您可以观看加州理工学院的讲座,从CaltechX - CS1156x Learning from data开始。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-07-08
      • 1970-01-01
      • 2018-09-29
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多