【发布时间】:2017-07-23 15:26:11
【问题描述】:
scikit-learn 是否有一个可以运行多个其他估算器并自动选择性能最佳的估算器(例如,根据它们的交叉验证分数)?
我相信在一个符合估算器接口的类中一定有这样的东西,这样它就可以组合成一个pipeline——对吗?
【问题讨论】:
-
我想你的意思是一个集成方法scikit-learn.org/stable/modules/ensemble.html ?但我对你的问题感到困惑。 Cross_validation 是通过聚合示例得出的,因此如果您最终要选择一个最佳分类器,则根据 cross_validation 错误选择最佳分类器将是您在预处理和测试中要做的事情。如果这不是你所追求的,你能澄清这个问题吗?
-
通常我会使用交叉验证来测试不同估计器的性能。然后我会手动选择表现最好的进行最终预测。现在我想使用 sklearn 管道实现我的整个工作流程,所以我相信这最后一步也需要由一个实现估计器接口的类来执行。我不相信“集成方法”是正确的答案——预测不应该结合起来。
-
IMO,scikit 不包含任何你想要的东西。但你可以从这里得到提示:scikit-learn.org/stable/auto_examples/classification/…
标签: python machine-learning scikit-learn data-science