【发布时间】:2020-05-08 03:01:30
【问题描述】:
我将数据集分为训练和测试。最后,在为训练数据集找到最佳超参数后,我是否应该使用所有数据再次拟合模型?关键是要达到新数据的最高分。
【问题讨论】:
标签: machine-learning data-science
我将数据集分为训练和测试。最后,在为训练数据集找到最佳超参数后,我是否应该使用所有数据再次拟合模型?关键是要达到新数据的最高分。
【问题讨论】:
标签: machine-learning data-science
是的,这将有助于泛化您的模型,因为更多的数据通常意味着更好的泛化。
【讨论】:
我不这么认为。如果这样做,您将不再拥有有效的测试集。当您稍后回来改进模型时会发生什么?如果你这样做,那么每次模型改进都需要一个新的测试集,这意味着更多的标签。您将无法比较模型版本之间的实验,因为测试集不会相同。
如果你认为这个模型永远完成了,那么好的。
【讨论】: