【发布时间】:2021-10-03 03:01:22
【问题描述】:
我对 GridSearchCV 如何与 Train Test Split 一起工作感到有些困惑。
据我所知,在为我正在使用的数据集创建模型时,一篇论文使用了 roc-auc。
我正在尝试复制这篇论文所做的,至少尽我所能。通过阅读这里的其他几篇文章,我了解到在整个数据集上运行 GridSearchCV 容易出现过拟合,因此我们应该将数据分成训练分区和测试分区。然后,我们应该使用 GridSearchCV 使用任何模型和参数运行训练分区,然后对其进行拟合,然后使用我们预留的数据集的测试部分获得分数。
现在我对 GridSearchCV 感到困惑,据我了解,它为我们提供了在搜索参数和使用 best_score_ 时数据被分成的每个折叠的分数,我们可以从中提取出最好的分数。我不明白分数代表什么以及为什么你可以传入一个评分参数开始,因为 GridSearchCV 的工作是总是找到最好的参数? (也许我在这里做了一个糟糕的假设,但我假设有一个客观的最佳参数集,无论评分方法如何)。我的想法是,我会使用 GridSearchCV 找到最佳参数,然后使用所述参数创建拟合模型,最后使用该模型和我保存的分区进行测试,并使用 roc-auc 评分方法对其进行测试。
所以最后,我传递给 GridSearchCV 的评分方法是否重要(如果有的话),因为无论如何它总是会给出最好的参数集,我将用它来计算我的最终分数测试分区?
【问题讨论】:
标签: python scikit-learn rdkit