【问题标题】:What validation for outlier detection?异常值检测的验证是什么?
【发布时间】:2016-05-02 12:37:52
【问题描述】:

另一个关于数据科学的一般性问题! 假设我有一堆样本,我必须检测每个样本的异常值。我的数据是单变量的,所以我可以使用简单的方法,如标准偏差或中值绝对偏差。

现在我的问题是:如何进行任何类型的验证来查看结果是否一致,尤其是如果由于数据的大小而不能用肉眼观察它们的话?例如,选择使用多少标准差来定义异常值。到目前为止,我还没有看到任何定量方法。它甚至存在吗?

干杯

【问题讨论】:

  • 这取决于上下文。一般无法回答这个问题。
  • 它如何依赖于上下文?有什么例子吗?

标签: machine-learning statistics probability outliers


【解决方案1】:

有趣的是,您没有定义“数据大小”的维度。我认为这在这里很重要。例如,您可以为高维数据绘制 q-q 图,但对于许多数据点来说并不那么容易。

但是,在寻找通用方法时,我会从概率的角度来解决这个问题。这永远不会告诉您哪个数据点是异常值,但是,它会告诉您有异常值的概率是多少(在数据的某些区域)。 我必须做出两个假设(a)您知道您的数据源自的分布族,例如正态或泊松(b)您可以在给定数据集的情况下估计该族的参数。

现在您可以定义您的数据来自此分布的假设以及数据不来自此分布的替代假设 (H0)。如果您从估计的分布中抽取随机样本,则该抽取的分布平均应该与您观察到的样本一样可能来自分布。如果不是这种情况

但是,可能更有趣的是找到包含异常值的子空间。这可以通过以下经验过程来完成。如果你现在估计你的分布参数给你的数据。您可以将估计的分布与所见数据的直方图进行比较。这为直方图的每个 bin 提供了 ic 包含异常值的概率。对于高维数据,这可以通过程序进行检查。

【讨论】:

  • 好吧,如果我理解正确的话,这是从正态分布中排除 X 标准差以外的所有内容的概括。为了回答你,我必须将此应用于大小不同的数据:每个独立系列的记录从 10 到 10,000 条。
  • 感谢您回答我的问题 CAFEBABE :) 你帮了大忙
  • @Luks:是的,这正是 6 sigma 背后的想法。它实际上可以推广到多模态分布。但是,那里可能会变得非常棘手。
猜你喜欢
  • 2019-01-20
  • 2019-09-05
  • 1970-01-01
  • 2020-05-20
  • 2014-09-29
  • 2014-09-15
  • 2019-07-24
  • 1970-01-01
  • 2017-07-18
相关资源
最近更新 更多