【发布时间】:2021-03-25 20:48:21
【问题描述】:
在我的数据集中,C1 和 C2 的两个特征高度相关。我做了以下步骤。您能否让我知道它是否正确且有意义?你有更好的方法吗?
首先我使用线性模型来找到拟合线: C1=a*C2+b
from sklearn import linear_model
reg=linear_model.LinearRegression()
y_reg = data1['C1']
x_reg = data1['C2']
reg.fit(x_reg2,y_reg2)
a=reg.coef_
b=reg.intercept_
print(a,b)
在找到 a 和 b 后,我从数据集中删除了 C1 和 C2 并添加了一个新的 Vriable:new=a*C1+b
我的下一个问题是如何理解这条线好不好?
【问题讨论】:
-
如果您的目标是进行预测,那么保留这两个变量就可以了。如果您使用 LR 来解释自变量和因变量之间的关系,则可以采取一系列措施来处理相关措施。无论哪种方式,您都可以运行两个不同的 LR 并保持误差最低(或性能最高)的一个,或者您可以使用处理多重共线性的技术 (statisticsbyjim.com/regression/…),例如方差膨胀因子 (kaggle.com/ffisegydd/sklearn-multicollinearity-class)。
标签: linear-regression correlation feature-selection