【问题标题】:best way to statistically detect anomalies in data统计检测数据异常的最佳方法
【发布时间】:2010-05-18 10:34:56
【问题描述】:

我们的网络应用程序收集了大量关于用户操作、网络业务、数据库负载等的数据

所有数据都存储在仓库中,我们对这些数据有很多有趣的看法。

如果有可能发生奇怪的事情,它会显示在数据的某个地方。

但是,要手动检测是否发生了异常情况,就必须不断查看这些数据,并寻找异常情况。

我的问题:检测动态数据变化的最佳方法是什么,可以被视为“不寻常”。

贝叶斯过滤器(我在阅读垃圾邮件检测时已经提到过这些)是要走的路吗?

任何指针都会很棒!

编辑: 为了澄清数据,例如显示数据库负载的每日曲线。 这条曲线通常看起来与昨天的曲线相似 随着时间的推移,这条曲线可能会慢慢改变。

如果曲线每天都在某些范围内发生变化,那将会发出警告。

R

【问题讨论】:

    标签: database statistics data-warehouse


    【解决方案1】:

    看看Control Charts,它们提供了一种直观地跟踪数据变化并指定数据何时“失控”或“异常”的方法。它们大量用于制造以确保质量控制。

    【讨论】:

      【解决方案2】:

      如果不详细了解您所拥有的特定数据,就无法回答这个问题。有关存在哪些方法的概述,请参阅 Chandola、Banerjee 和 Kumar 的 Anomaly Detection: A Survey

      【讨论】:

        【解决方案3】:

        贝叶斯分类可能帮助您在数据中发现一些异常,具体取决于数据类型和贝叶斯过滤器的训练程度。

        甚至还有一个可用作网络服务@uClassify.com

        【讨论】:

          【解决方案4】:

          这在很大程度上取决于数据是什么。参加统计课程并首先学习基础知识。这通常不是一个容易或简单的问题。

          【讨论】:

          • 很好的答案。真的很有帮助;^)
          • 甚至是一个恰当的问题。你所说的异常到底是什么意思?
          猜你喜欢
          • 2019-09-05
          • 2017-03-26
          • 1970-01-01
          • 1970-01-01
          • 2014-10-06
          • 2011-07-19
          • 2013-06-09
          • 2011-02-17
          • 2014-05-23
          相关资源
          最近更新 更多