【发布时间】:2021-03-23 04:09:33
【问题描述】:
我正在尝试使用 Scikit-Learn 的随机森林回归器根据实际 GDP 预测名义 GDP。
我从网站上读取数据并稍微清理一下,然后将数据框与我预测的未来三年的实际 GDP 合成一个数据框。
我有以下代码:
from sklearn.ensemble import RandomForestRegressor
gdp = pd.read_html('https://www.thebalance.com/us-gdp-by-year-3305543')[0]
gdp.columns = gdp.iloc[0]
gdp = gdp[1:]
gdp['Year'] = gdp['Year'].astype(int)
gdp['Nominal GDP (trillions)'] = gdp['Nominal GDP (trillions)'].str.replace(',', '.').str.replace('$', '').astype(float)
gdp['Real GDP (trillions)'] = gdp['Real GDP (trillions)'].str.replace(',', '.').str.replace('$', '').astype(float)
X = pd.DataFrame(gdp['Real GDP (trillions)'].copy())
y = pd.DataFrame(gdp['Nominal GDP (trillions)'].copy())
X_pred = pd.DataFrame(data = [18.313, 18.960, 19.643], columns = ['Real GDP (trillions)'])
reg = RandomForestRegressor(n_estimators = 300)
reg.fit(X, y.values.ravel())
y_pred = reg.predict(X_pred)
它返回以下预测: 1 | 2 | 3 ---|---|--- 19.72172 | 21.05464667 | 21.05464667
为什么第二个和第三个预测相同?即使我将 X_pred 值更改为 [18.313, 18.960, 39.643]
【问题讨论】:
-
要预测 RF 将您的数据通过经过训练的树传递,在您的示例中并行 300 个,如果数据最终出现在相同的叶子中,则预测将是相同的。您可以使用
reg._estimators检查估算器
标签: python scikit-learn random-forest ensemble-learning