【问题标题】:Unorderable Types: str() > float error KNN modelUnorderable Types: str() > float error KNN model
【发布时间】:2016-12-03 03:48:35
【问题描述】:

我已经阅读了很多关于这个特定错误的内容,但无法找到解决我问题的答案。我有一个数据集,已拆分为训练集和测试集,并希望运行 KNeighborsClassifier。我的代码在下面...我的问题是,当我查看 X_train 的 dtypes 时,我根本看不到任何字符串格式的列。我的 y_train 是一个单一的分类变量。这是我的第一篇 stackoverflow 帖子,如果我忽略了任何手续,我深表歉意,并感谢您的帮助! :)

错误:

TypeError: unorderable types: str() > float()

数据类型:

X_train.dtypes.value_counts()
Out[54]: 
int64      2035
float64     178
dtype: int64

代码:

# Import Packages 
import os
import pandas as pd 
import numpy as np
import matplotlib.pyplot as plt
from sklearn.dummy import DummyRegressor
from sklearn.cross_validation import train_test_split, KFold
from matplotlib.ticker import FormatStrFormatter
from sklearn import cross_validation
from sklearn.neighbors import KNeighborsClassifier
from sklearn.svm import SVC
import pdb

# Set Directory Path 
path = "file_path"
os.chdir(path)

#Select Import File
data = 'RawData2.csv' 
delim = ','

#Import Data File
df = pd.read_csv(data, sep = delim)
print (df.head())

df.columns.get_loc('Categories')

#Model 

#Select/Update Features
X = df[df.columns[14:2215]]

#Get Column Index for Target Variable
df.columns.get_loc('Categories')

#Select Target and fill na's with "Small" label
y = y[y.columns[21]]
print(y.values)
y.fillna('Small')

#Training/Test Set
X_sample = X.loc[X.Var1 <1279]
X_valid = X.loc[X.Var1 > 1278]
y_sample = y.head(len(X_sample))
y_test = y.head(len(y)-len(X_sample))

X_train, X_test, y_train, y_test = train_test_split(X_sample, y_sample, test_size = 0.2)
cv = KFold(n = X_train.shape[0], n_folds = 5, random_state = 17)

print(X_train.shape, y_train.shape)
X_train.dtypes.value_counts()

from sklearn.neighbors import KNeighborsClassifier
from sklearn.metrics import accuracy_score

knn = KNeighborsClassifier(n_neighbors = 5)
knn.fit(X_train, y_train) **<-- This is where the error is flagged** 
accuracy_score(knn.predict(X_test))

【问题讨论】:

    标签: python-3.x machine-learning compiler-errors


    【解决方案1】:

    sklearn 中的所有内容都基于仅使用数字的 numpy。因此,分类 X 和 Y 需要编码为数字。对于 x,您可以使用 get_dummies。对于 y,您可以使用 LabelEncoder。

    http://scikit-learn.org/stable/modules/generated/sklearn.preprocessing.LabelEncoder.html

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-03-03
      • 1970-01-01
      • 1970-01-01
      • 2021-02-07
      • 2022-12-01
      • 1970-01-01
      • 2010-12-19
      相关资源
      最近更新 更多