【问题标题】:LIME ML Interpreter mode Classification or Regression for Isolation Forest (Anomaly Detection)隔离森林的 LIME ML 解释器模式分类或回归(异常检测)
【发布时间】:2021-01-04 01:27:47
【问题描述】:
我正在尝试在我的 1000 多个文档的数据集中查找异常情况。我正在使用 LIME ML Interpreter 来解释模型(隔离森林)的预测。在一个参数“模式”中,我可以在分类和回归之间进行选择。我没有一组已知异常的文档。
由于隔离森林是一种无监督学习方法,而分类是一种监督学习,用于将观察结果分类为两个或更多类,我最终使用回归。另一方面,我有结果异常或没有异常。
这里有什么用?
最好的问候,
爱丽儿
【问题讨论】:
标签:
python
regression
classification
anomaly-detection
lime
【解决方案1】:
对于我们来说,我们所做的如下:
- 使用隔离森林获取异常。
- 将 Isolation Forest 返回的 1 和 -1 视为类标签并构建随机森林分类器。
- 将此随机森林分类器传递给 LIME 以获得异常点的解释。
我们也在努力寻找更好的选择,而不是构建二级随机森林分类器。
【解决方案2】:
不直接与 LIME 相关,但 Shapley 值可用于为 IsolationForest 创建类似的解释。见this answer。
【解决方案3】:
我看到的另一个选项是在 IsoForest 树构建期间保留 10-20% 的数据集。在这个坚持上对模型进行评分并获得异常分数(或平均树深度)并在此基础上构建解释器。然后在对新数据进行评分时,LIME 会将其视为回归问题...虽然我不确定这将如何运作...