【发布时间】:2018-08-22 06:54:10
【问题描述】:
我想展示一个模型的示例,该模型过度拟合了一个测试集并且不能很好地概括未来的数据。
我将新闻数据集分成 3 组:
train set length: 11314
test set length: 5500
future set length: 2031
我正在使用一个文本数据集并构建一个CountVectorizer。
我正在创建一个网格搜索(没有交叉验证),每个循环都将测试矢量化器上的一些参数('min_df'、'max_df')和我的模型LogisticRegression 上的一些参数('C'、'fit_intercept'、'托尔',...)。
我得到的最好结果是:
({'binary': False, 'max_df': 1.0, 'min_df': 1},
{'C': 0.1, 'fit_intercept': True, 'tol': 0.0001},
test set score: 0.64018181818181819,
training set score: 0.92902598550468451)
但现在如果我在未来的集合上运行它,我将得到与测试集相似的分数:
clf.score(X_future, y_future): 0.6509108813392418
我如何证明我过拟合了我的测试集,因此它不能很好地推广到未来的数据?
【问题讨论】:
标签: machine-learning classification logistic-regression