【问题标题】:Label or score outliers in R在 R 中标记或评分异常值
【发布时间】:2015-12-28 12:16:33
【问题描述】:

我正在寻找 R 中一些易于使用的算法来逐行标记(异常值与否)或评分(例如,7.5)异常值。意思是,我有一个矩阵m,其中包含几行,我想识别与其他行相比代表异常值的行。

m <- matrix( data = c(1,1,1,0,0,0,1,0,1), ncol = 3 )

为了进一步说明,我想将矩阵中的所有(完整)行相互比较以发现异常值。

【问题讨论】:

  • 这个范围很广。你能缩小范围吗?举个例子?
  • 阅读thisthis,然后更新您的问题以符合这些准则。

标签: r outliers


【解决方案1】:

这是我几年前写的一些非常简单的异常值检测(使用箱线图统计或数据分位数)。

Outliers

但是,如上所述,如果您能更准确地描述您的问题,将会很有帮助。

编辑:

你还说你想要row-wise异常值。您的意思是说您有兴趣识别变量中的整行与观察值(通常是这样做的)?如果是这样,您将需要使用某种距离度量,但您选择哪种度量将取决于您的数据。

【讨论】:

  • 谢谢你,亚历克斯!我在原始问题中添加了一些信息。我不完全确定我理解您对逐行异常值的理解。如上所述,我想将给定行中的所有信息(即给定行中的所有单元格)与矩阵中的所有其他行进行比较。
  • 所以,(a) 你的矩阵m 非常无用; (b) 您对“行异常值”的定义不是传统意义上的异常值。它是在 p-dim 空间中感测它们之间距离较大的观测值,例如 dist(m)
  • 谢谢你,亚历克斯!这正是我想要的!但是我如何阅读 dist 表?顺便说一句:我提供的矩阵与我实际拥有的非常接近。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2019-06-24
  • 2013-02-17
  • 2020-12-24
  • 1970-01-01
  • 2015-07-06
  • 1970-01-01
  • 2020-08-27
相关资源
最近更新 更多