【发布时间】:2016-09-30 16:24:05
【问题描述】:
在 Spark Mllib 中训练随机森林二元分类器模型时如何获得模型指标(F 分数、AUROC、AUPRC 等)?
问题在于BinaryClassificationMetrics 采用概率,而 RandomForest 分类器的 predict 方法返回离散值 0 或 1。
见:https://spark.apache.org/docs/latest/mllib-evaluation-metrics.html#binary-classification
RandomForest.trainClassifier 没有任何 clearThreshold 方法可以使其返回概率而不是离散的 0 或 1 标签。
【问题讨论】:
-
@eliasah 实际上不是重复的问题,但那里的答案提供了问题的解决方案。在您发表评论之前,我已经在答案中添加了这一点。
-
没关系。没问题 !因此使用“可能”这个词
-
@eliasah 这个问题实际上并不重复,因为它没有询问指标。那里的答案确实指向新的
mlAPI,它有助于找到解决方案。请参阅调整后的 apache 文档示例以适合此问题的更新答案。
标签: scala apache-spark apache-spark-mllib