【问题标题】:Scikit-Learn: Supported target types are: ('binary', 'multiclass'). Got 'unknown' insteadScikit-Learn:支持的目标类型是:('binary', 'multiclass')。改为“未知”
【发布时间】:2021-12-18 10:59:12
【问题描述】:

我有一个产品的 2 个名义值(类别和生产商)及其价格,并尝试确定在任何给定类别中生产商是否通常具有更高的价格。换句话说,我试图衡量一个品牌对价格的影响。我使用了下面的 Python 代码,但无法运行并出现此错误:

Supported target types are: ('binary', 'multiclass'). Got 'unknown' instead.

您能帮我解决这个问题吗?

# Load dataset
path = "Sales.xlsx"
names = ['Category', 'Producer', 'Average_base_price']
dataset = read_excel(path, dtype={'Average_base_price':float} ,names=names)

# creating instance of labelencoder
labelencoder = LabelEncoder()

array = dataset.values

# Split-out validation dataset
X, y = array[:, :-1], array[:, -1]

X[:, 0] = labelencoder.fit_transform(X[:, 0])
X[:, 1] = labelencoder.fit_transform(X[:, 1])

X_train, X_validation, Y_train, Y_validation = train_test_split(X, y, test_size=0.20, random_state=1)

# Spot Check Algorithms
models = []
models.append(('LR', LogisticRegression(solver='liblinear', multi_class='ovr')))
models.append(('LDA', LinearDiscriminantAnalysis()))
models.append(('KNN', KNeighborsClassifier()))
models.append(('CART', DecisionTreeClassifier()))
models.append(('NB', GaussianNB()))
models.append(('SVM', SVC(gamma='auto')))

# evaluate each model in turn
results = []
names = []

for name, model in models:
    kfold = StratifiedKFold(n_splits=10, random_state=1, shuffle=True)
    cv_results = cross_val_score(model, X_train, Y_train, cv=kfold, scoring='accuracy')
    results.append(cv_results)
    names.append(name)
    print('%s: %f (%f)' % (name, cv_results.mean(), cv_results.std()))

【问题讨论】:

  • 能否请您复制并粘贴整个错误消息?以便我们知道是哪条线路或哪个功能导致了问题。另外,您能显示y 变量的前10 个元素吗?您正在使用LogisticRegression,但您的Average_base_price 似乎是一个连续变量。

标签: python scikit-learn


【解决方案1】:

您会收到该错误,因为您的因变量是连续的,并且您正在尝试执行没有意义的分层 kfold

如你所说:

换句话说,我试图衡量一个品牌对价格的影响。

那么你的因变量应该是价格。您的自变量将是标称值。而且你应该使用 one-hot 编码而不是标签编码,因为它们不是预测变量,也不是标签。

使用示例数据集:

from sklearn.preprocessing import OneHotEncoder
from sklearn.model_selection import train_test_split, StratifiedKFold
from sklearn.linear_model import LinearRegression
from sklearn.model_selection import cross_val_score
import numpy as np
import pandas as pd

dataset = pd.DataFrame({'Category':np.random.choice(['A','B','C'],100),
'Producer':np.random.choice(['l','m','n'],100),
'Average_base_price':np.random.uniform(0,1,100)})

Onehot 编码预测器:

enc = OneHotEncoder(handle_unknown='ignore')
X = enc.fit_transform(dataset[['Category','Producer']])
y = dataset[['Average_base_price']]

X_train, X_validation, Y_train, Y_validation = train_test_split(X, y, test_size=0.20, random_state=1)

然后拟合模型,在这种情况下,您可以使用例如简单的线性回归:

model = LinearRegression()
cv_results = cross_val_score(model, X_train, Y_train, cv=10)

【讨论】:

    猜你喜欢
    • 2020-11-08
    • 2020-02-23
    • 2021-05-03
    • 2018-07-08
    • 2021-05-10
    • 2021-10-02
    • 2018-01-15
    • 1970-01-01
    • 2016-06-05
    相关资源
    最近更新 更多