【问题标题】:Evaluation in ElkiElki 中的评估
【发布时间】:2016-05-11 16:06:19
【问题描述】:

我知道 ELKI 目前只包含无监督异常值检测方法,因此 Elki 不会将输入数据分为训练集和测试集。 但是,我已经看到评估在可用时超过了少数类。我想知道:

  1. elki 是否使用所有输入数据进行评估?
  2. 运行时是考虑评估还是只考虑训练时间?
  3. 评估是否考虑离群值分数来估计假阳性率和真阳性率以评估排名?
  4. 例如,在 LOF 算法中,假设普通类中的实例具有较高的 LOF 分数。在评估中会被认为是假阳性还是真阳性?

谢谢!

【问题讨论】:

  • 没有训练数据就没有“训练时间”。只需阅读一些关于异常值评估的论文。

标签: outliers unsupervised-learning elki


【解决方案1】:
  1. 是的,所有输入都用于无监督方法。

    标签不得用于运行算法,它们仅在评估时使用。

  2. 每个算法报告的运行时间是分开的。

  3. 这取决于您的评价。大多数度量(例如 ROC AUC)只会考虑排名。要评估实际分数,您首先需要对它们进行标准化。有关将(标准化)分数考虑在内的衡量标准,请参阅

    E.舒伯特,R. Wojdanowski,A. Zimek,H.-P。 Kriegel
    关于异常值排名和异常值分数的评估
    第 12 届 SIAM 数据挖掘国际会议 (SDM) 会议记录,加利福尼亚州阿纳海姆:1047–1058,2012。

  4. 真阳性和假阳性需要二元决策。请参阅 ROC AUC,了解不需要指定阈值来进行二元决策的方法,而是评估所有可能的阈值。

【讨论】:

    猜你喜欢
    • 2017-03-15
    • 2016-08-19
    • 1970-01-01
    • 2020-08-08
    • 2010-11-14
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多