【问题标题】:Why is the polynomial regression returning the same results for different grades?为什么多项式回归对不同等级返回相同的结果?
【发布时间】:2020-10-12 05:50:25
【问题描述】:

我有这个数据框,我想计算臭氧的多项式回归。我将 o3 作为 y 值传递,将日期作为 x 值传递。为什么我的多项式回归在 2 到 15 年级看起来一样?我比较了4年级和15年级,没有区别...我将得到的回归与CurveExpert软件进行比较,它们完全不同...如何解决问题并查看4年级和15年级之间的差异?

import matplotlib.pyplot as plt
import datetime as dt
import pandas as pd

# Importing the dataset
dataset = pd.read_csv('https://raw.githubusercontent.com/iulianastroia/csv_data/master/final_dataframe.csv')


dataset['day'] = pd.to_datetime(dataset['day'], dayfirst=True)
dataset = dataset.sort_values(by=['readable time'])
print(dataset.head())

group_by_df = pd.DataFrame([name, group.mean()["o3"]] for name, group in dataset.groupby('day'))
group_by_df.columns = ['day', "o3"]
group_by_df['day'] = pd.to_datetime(group_by_df['day'])
group_by_df['day'] = group_by_df['day'].map(dt.datetime.toordinal)
X = group_by_df[['day']].values
y = group_by_df[['o3']].values

# Splitting the dataset into the Training set and Test set
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=0)


# Fitting Linear Regression to the dataset
from sklearn.linear_model import LinearRegression
lin_reg = LinearRegression()
lin_reg.fit(X, y)

# Visualizing the Linear Regression results
def viz_linear():
    plt.scatter(X, y, color='red')
    plt.plot(X, lin_reg.predict(X), color='blue')
    plt.title('Linear Regression')
    plt.xlabel('Date')
    plt.ylabel('O3 levels')
    plt.show()
    return
viz_linear()

# Fitting Polynomial Regression to the dataset
from sklearn.preprocessing import PolynomialFeatures
poly_reg = PolynomialFeatures(degree=15)
X_poly = poly_reg.fit_transform(X)
pol_reg = LinearRegression()
pol_reg.fit(X_poly, y)

# Visualizing the Polymonial Regression results
def viz_polymonial():
    plt.scatter(X, y, color='red')
    plt.plot(X, pol_reg.predict(poly_reg.fit_transform(X)), color='blue')
    plt.title('poly Regression grade 15')
    plt.xlabel('Date')
    plt.ylabel('O3 levels')
    plt.show()
    return
viz_polymonial()

【问题讨论】:

    标签: python pandas machine-learning scikit-learn regression


    【解决方案1】:

    你离得很近。干得好,你有很多事情要做。

    我认为您想将这样的测试集拟合为线性:

    # Fitting Linear Regression to the dataset
    from sklearn.linear_model import LinearRegression
    lin_reg = LinearRegression()
    lin_reg.fit(X_test, y_test)
    

    多项式也是这样:

    # Fitting Polynomial Regression to the dataset
    from sklearn.preprocessing import PolynomialFeatures
    poly_reg = PolynomialFeatures(degree=15)
    X_poly = poly_reg.fit_transform(X_test)
    pol_reg = LinearRegression()
    pol_reg.fit(X_poly, y_test)
    

    现在曲线在视觉上显示出很大的不同

    【讨论】:

    • 如果我在 x 轴上使用从 1 到 dataframe+1 的 len 的数字,会不会出错?我认为 posix 代码在回归中给了我错误的结果:dataset['numbered'] = '' for i in range(1, len(dataset) + 1): dataset.loc[i - 1, ['numbered']] = i X = dataset[['numbered']].values
    • 我想我记得 (n+1, 1) 是采用这种方法的方法,但我会检查并确认并回复您... JP
    • 谢谢@Jeanpierre Fisher,期待您的回复 :)
    • 看看这里:scikit-learn.org/stable/modules/generated/… 我认为这会让你走上正轨,它说:生成多项式和交互特征。生成一个新的特征矩阵,由度数小于或等于指定度数的特征的所有多项式组合组成。例如,如果输入样本是二维的,形式为 [a, b],则 2 次多项式特征为 [1, a, b, a^2, ab, b^2]。
    猜你喜欢
    • 2017-04-01
    • 1970-01-01
    • 2018-03-04
    • 2016-08-30
    • 2012-07-28
    • 2013-03-10
    • 1970-01-01
    • 2017-10-17
    • 1970-01-01
    相关资源
    最近更新 更多