【问题标题】:How can I study the properties of outliers in high-dimensional data?如何研究高维数据中异常值的属性?
【发布时间】:2020-08-26 10:06:43
【问题描述】:

我有一堆高维数据,这些实例是否被标记为异常值。我希望了解这些异常值在数据中的位置。我试图回答以下问题:

  1. 异常值是否彼此相距很远?还是它们聚集在一起?
  2. 异常值是否位于良好数据集群的“中间”?还是它们位于数据的“边缘”边界?
  3. 如果异常值聚集在一起,这些集群密度与良好数据的集群相比如何?
  4. 异常值在哪里?

什么样的技术可以让我找到这些见解?如果数据是 2 或 3 维的,我可以轻松地绘制数据并查看。但是高维数据我做不到。

【问题讨论】:

  • 这可能更适合统计网站 Cross Validated SE。
  • 你有几个维度?它是什么样的数据?

标签: data-visualization cluster-analysis outliers anomaly-detection


【解决方案1】:

分析异常值的统计属性

  • 首先,如果您可以选择专注于特定功能。为了 例如,如果您知道某个特征的变化很大,您可以 绘制箱形图。如果您想专注于,您还可以绘制二维图形 2个特点。这显示了标记的异常值有多少变化。

  • 接下来,有一个称为 Z 分数的指标,它基本上说明了如何 与平均值相比,一个点的许多标准差有所不同。这 Z-score 是有符号的,这意味着如果一个点低于平均值,则 Z-score 将是负面的。这可以用来分析所有的特征 数据集。您可以在标记的数据集中找到阈值,高于该阈值的所有点都被标记为异常值

  • 最后,我们可以找到四分位数范围并进行类似的过滤 基于它。 IQR 只是 75 之间的差异 百分位数和 25 个百分位数。您也可以将其与 Z-score 类似地使用。

使用这些技术,我们可以分析异常值的一些统计特性。 如果您还想分析集群,可以根据您的问题调整 DBSCAN 算法。该算法基于密度对数据进行聚类,因此很容易将这些技术应用于异常值。

【讨论】:

    猜你喜欢
    • 2016-12-13
    • 1970-01-01
    • 1970-01-01
    • 2022-12-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-10-09
    相关资源
    最近更新 更多