【发布时间】:2018-02-27 10:06:41
【问题描述】:
我有一个包含 m 个观测值和 p 个分类变量(名义)的数据集,每个变量 X1,X2...Xp 有几个不同的类(可能的值)。最终,我正在寻找一种发现异常的方法,即识别相对于我目前看到的数据而言值组合似乎不正确的行。到目前为止,我正在考虑构建一个模型来预测每列的值,然后构建一些度量来评估实际行与预测行的差异。我将不胜感激任何帮助!
【问题讨论】:
-
这个问题最好发到ai.stackexchange.com
-
让我理解得很好......所以了解记录是否不正确的标准是基于该类别中术语的频率?如果一个术语出现几次可能是不正确的,这是你的估值吗?你能展示你的数据样本吗?
-
基本上我在考虑与市场篮子分析进行类比。如果某些值经常一起出现,并且只有一次某个值似乎完全错过了该模式,我想标记一下。类似于识别异常值但针对多类分类数据
标签: python machine-learning statistics data-science