【问题标题】:find anomalies in records of categorical data查找分类数据记录中的异常
【发布时间】:2018-02-27 10:06:41
【问题描述】:

我有一个包含 m 个观测值和 p 个分类变量(名义)的数据集,每个变量 X1,X2...Xp 有几个不同的类(可能的值)。最终,我正在寻找一种发现异常的方法,即识别相对于我目前看到的数据而言值组合似乎不正确的行。到目前为止,我正在考虑构建一个模型来预测每列的值,然后构建一些度量来评估实际行与预测行的差异。我将不胜感激任何帮助!

【问题讨论】:

  • 这个问题最好发到ai.stackexchange.com
  • 让我理解得很好......所以了解记录是否不正确的标准是基于该类别中术语的频率?如果一个术语出现几次可能是不正确的,这是你的估值吗?你能展示你的数据样本吗?
  • 基本上我在考虑与市场篮子分析进行类比。如果某些值经常一起出现,并且只有一次某个值似乎完全错过了该模式,我想标记一下。类似于识别异常值但针对多类分类数据

标签: python machine-learning statistics data-science


【解决方案1】:

看看最近邻域法和聚类分析。指标可以是简单的(如平方误差),甚至可以是自定义的(每个类别都有预定义的权重)。

最近的邻域将回答“当前行与另一行有何不同”的问题,聚类分析将回答“是否离群值”的问题。此外,一些可视化可能会有所帮助(T-SNE)。

【讨论】:

    猜你喜欢
    • 2021-08-20
    • 1970-01-01
    • 2020-06-01
    • 2016-01-26
    • 2020-01-17
    • 2013-11-26
    • 2020-10-29
    • 2015-05-15
    • 1970-01-01
    相关资源
    最近更新 更多