【发布时间】:2016-08-20 20:08:35
【问题描述】:
我有一个模型用于两个数据集,即训练和测试。在使用 scikit-learn 构建模型之前,我需要对预测变量进行归一化。
假设我的模型训练数据:
Training[X1] has mean=10,stddev=1.5
Training[X2] has mean=45,stddev=17
etc...
还有我的测试数据文件
Testing[X1] has mean=9,stddev=1.8
Testing[X2] has mean=40,stddev=13
etc...
如何规范化测试数据文件,使其使用与原始数据集相同的比例?
我尝试使用此代码,但乍一看似乎不正确:
from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
scaler.fit(X_train)
X_train = scaler.transform(X_train)
X_test = scaler.transform(X_test)
【问题讨论】:
标签: python python-2.7 machine-learning scikit-learn