【问题标题】:When true positives are rare当真阳性很少见时
【发布时间】:2017-09-11 05:25:01
【问题描述】:

假设您尝试将机器学习用于分类任务,例如查看动物照片并区分马和斑马。这项任务似乎是最先进的。

但是,如果您拍摄一堆带标签的照片,然后将它们扔到神经网络或支持向量机之类的东西上,那么在实践中会发生的情况是,斑马比马要少得多,以至于系统最终只会学会说“总是一匹马”,因为这实际上是最小化错误的方法。

可能是最小的错误,但它也不是一个非常有用的结果。告诉系统“我想最好地猜测哪些照片是斑马,即使这确实会产生一些误报”,推荐的方法是什么?这个问题好像讨论的不多。

【问题讨论】:

  • 就在我的脑海里,你能不能在一个人为地高比例斑马的数据集上训练一个模型,然后用它在实际照片中找到斑马稀有的地方?
  • 另外,我想提一下,您可能会在 Stack Overflow 的姊妹网站“Cross Validated”上得到更好的回应(或找到类似的问题)。 stats.stackexchange.com

标签: machine-learning


【解决方案1】:

我通常对不平衡的类(或倾斜的数据集)做的事情之一就是生成更多数据。我认为这是最好的方法。你可以走出现实世界,收集更多不平衡类的数据(例如,找到更多斑马的图片)。您还可以通过简单地制作副本或通过转换复制数据(例如水平翻转)来生成更多数据。

您还可以选择一个分类器,该分类器使用替代评估(性能)指标而不是通常使用的指标 - 准确度。查看精度/召回率/F1 分数。

Andrew Ng 的 ML 课程第 6 周谈到了这个话题:link

这是我发现的另一个关于处理不平衡类的好网页:link

【讨论】:

    【解决方案2】:

    对于这种类型的不平衡数据问题,学习与每个类相关的模式而不是简单地比较类是一种很好的方法 - 这可以首先通过无监督学习来完成(例如使用自动编码器)。 https://www.r-bloggers.com/autoencoders-and-anomaly-detection-with-machine-learning-in-fraud-analytics/amp/ 上有一篇很好的文章。另一个建议 - 在运行分类器之后,可以使用混淆矩阵来确定应该在哪里寻找额外的数据(即许多斑马错误)

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-04-22
      • 2022-01-17
      • 2016-02-03
      • 1970-01-01
      • 2018-07-24
      • 2015-09-28
      • 1970-01-01
      相关资源
      最近更新 更多