【问题标题】:predict() in pandas statsmodels, adding independent variablespandas statsmodels中的predict(),添加自变量
【发布时间】:2015-03-22 21:10:02
【问题描述】:

数据:https://courses.edx.org/c4x/MITx/15.071x_2/asset/climate_change.csv

我正在使用 pandas 构建多元线性回归模型:

import pandas as pd
import statsmodels.api as sm

climate = pd.read_csv("climate_change.csv")
climate_train = climate.query('Year <= 2006')
climate_test = climate.query('Year > 2006')

y = climate_train['Temp']
x = climate_train[['MEI', 'N2O', 'TSI', 'Aerosols']]
x = sm.add_constant(x)
model2 = sm.OLS(y, x).fit()
model2.summary()

我想在我的测试数据集上对其进行测试:

model2.predict(climate_test)

但我收到以下错误:

ValueError: shapes (24,11) and (5,) not aligned: 11 (dim 1) != 5 (dim 0)

来自this question,我怀疑这可能与我没有向我的测试数据集添加一个常数这一事实有关,但是

model2.predict(sm.add_constant(climate_test))

也不行。如果我明确列出自变量,它会起作用:

model2.predict(sm.add_constant(climate_test[['MEI', 'N2O', 'TSI', 'Aerosols']]))

但由于 model2 已经“知道”这些变量,我看不出为什么我应该在方法调用中重复它们。

如何在不显式调用自变量的情况下进行预测()?

【问题讨论】:

    标签: python pandas linear-regression statsmodels


    【解决方案1】:

    我认为没有办法完全自动完成。

    如果您要保存输入,请将“x 列”存储在一个变量中以供以后使用:xvars = ['MEI', 'N2O', 'TSI', 'Aerosols'] 并在代码的早期和后期使用它来保存输入。

    【讨论】:

      猜你喜欢
      • 2021-09-06
      • 2015-08-27
      • 2013-01-26
      • 2020-01-10
      • 1970-01-01
      • 2022-07-22
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多