【发布时间】:2017-03-20 09:44:09
【问题描述】:
假设我们的记录具有与我们试图预测的目标数字相关的多个特征。所有记录都遵循相同的基本模式,RandomForestRegressor 可以很好地学习。现在假设所有记录都添加了分类特征,可以将其编码为附加信息以提高模型的预测能力。到目前为止,一切顺利。
但是现在假设我们想要使用我们的回归器,该回归器是在包括分类特征的数据上训练的来预测具有未在训练数据。在这种情况下,分类信息是否变得无用(或更糟?)是否应该在没有可用分类信息的情况下重新训练模型以获得最佳泛化性能(因为它以前适合不在此数据集中的类别)?或者,知道训练数据中的类别成员是否可以提高对样本外类别的预测能力?
【问题讨论】:
-
“所有记录都属于几个组之一,可以编码为附加信息”:那么你预测什么?如果您尝试预测组并将组作为训练集的特征,实际上并没有学习,它只是对该特征的投影,因此无法预测看不见的数据......
-
我正在尝试预测一个与我称为组的分类特征不同的目标值。我会改写澄清。
-
例如,训练数据有一个变量“country”,其值为
[US, Canada],而在测试数据中,country 变量的值为[Mexico, Cuba]?如果这些集合没有交集,则不应包含该变量。如果您希望在测试数据中看到 一些 的原始值,那么您应该使用它。 -
@maxymoo 一些测试数据会与国家有交集,而有些则不会(假设 50% 不会)。为了在不交叉国家的情况下获得最佳数据性能,也许应该训练一个完全忽略这个维度的单独模型。
-
不包括它
标签: machine-learning scikit-learn regression random-forest