【问题标题】:ELKI data generator and outliersELKI 数据生成器和异常值
【发布时间】:2015-10-05 23:46:44
【问题描述】:

我想对 LOF 进行测试,展示它在管理数据集的密集-稀疏问题方面的能力。在 ELKI 数据生成器的教程中,我展示了如何从这样的 xml 文件制作数据集,其中包含 4 个集群:

<dataset random-seed="1" test-model="1">
<cluster name="Dense" size="290">
<normal mean="0.5" stddev="0.2"/>
<normal mean="0.5" stddev="0.2"/>
<clip min="0 0" max="1 1"/>
</cluster>

<cluster name="Sparse" size="100">
<normal mean="0.25" stddev="0.05"/>
<normal mean="0.75" stddev="0.05"/>
<clip min="0 0" max="1 1"/>
</cluster>

<cluster name="Middle" size="100">
<normal mean="0.75" stddev="0.05"/>
<normal mean="0.75" stddev="0.05"/>
<clip min="0 0" max="1 1"/>
</cluster>

<cluster name="Noise" size="10" density-correction="50">
<uniform min="0" max="1"/>
<uniform min="0" max="1"/>
</cluster>
</dataset>

但是我如何控制异常值。 ELKI 工具希望为异常值使用少数标签以显示 ROCAUC 曲线。而我从xml文件中得到的文件只是数据集中的一个点文件。

然后我是否应该制作一个情节并自己识别异常值并在它们后面加上是或否来说明它们是否是异常值并将少数标签设置为是、是异常值还是有更简单的方法?

【问题讨论】:

    标签: data-mining outliers elki


    【解决方案1】:

    ELKI 将默认使用最小的类进行评估。 (您可以以不同方式配置评估!)

    如果异常值超过数据的 5%,ELKI 将发出警告,因为假定异常值很少见(实际上它们应该远低于 5%)。

    所以在你的数据集上,ELKI 应该默认使用“Noise”作为异常类。

    在你的配置中Noise 应该是数据集的 2%,所以它不应该发出警告。它应该开箱即用。

    【讨论】:

    • ELKI 数据生成器只生成带有标签的 2D 集群是否正确理解?我可以将随机特征放入输出文件并获得多维数据集。但是后来我发现很难控制实验,因为我不确定我将放置的异常值是否是 X 维度上的真正异常值。研究人员如何在多维度上对其进行测试?我猜一开始总是 2D 和 3D。
    • 不,您可以根据需要生成任意数量的维度。网站上有640d的例子。只需向所有集群添加额外的发行版。我们已经尝试过这样的数据集,但合成数据的结果并不是特别有用。很难生成既不太容易也不太可能的数据集;并且将您的方法过度拟合到数据生成器(例如高斯混合模型)的可能性很大。
    猜你喜欢
    • 2015-11-22
    • 2015-01-09
    • 1970-01-01
    • 1970-01-01
    • 2013-12-20
    • 2014-05-31
    • 2017-02-08
    • 2022-06-17
    • 2013-11-20
    相关资源
    最近更新 更多