【发布时间】:2019-05-27 21:47:15
【问题描述】:
我尝试预测不同类别的条目消息,并研究了波斯语。我使用 Tfidf 和 Naive-Bayes 对输入数据进行分类。这是我的代码:
import pandas as pd
df=pd.read_excel('dataset.xlsx')
col=['label','body']
df=df[col]
df.columns=['label','body']
df['class_type'] = df['label'].factorize()[0]
class_type_df=df[['label','class_type']].drop_duplicates().sort_values('class_type')
class_type_id = dict(class_type_df.values)
id_to_class_type = dict(class_type_df[['class_type', 'label']].values)
from sklearn.feature_extraction.text import TfidfVectorizer
tfidf = TfidfVectorizer()
features=tfidf.fit_transform(df.body).toarray()
classtype=df.class_type
print(features.shape)
from sklearn.model_selection import train_test_split
from sklearn.feature_extraction.text import CountVectorizer
from sklearn.feature_extraction.text import TfidfTransformer
from sklearn.naive_bayes import MultinomialNB
X_train,X_test,y_train,y_test=train_test_split(df['body'],df['label'],random_state=0)
cv=CountVectorizer()
X_train_counts=cv.fit_transform(X_train)
tfidf_transformer=TfidfTransformer()
X_train_tfidf = tfidf_transformer.fit_transform(X_train_counts)
clf = MultinomialNB().fit(X_train_tfidf, y_train)
print(clf.predict(cv.transform(["خريد و فروش لوازم آرايشي از بانه"])))
但是当我运行上面的代码时,它会抛出以下异常,而我希望在输出中给我“ads”类:
Traceback(最近一次调用最后一次):文件“.../multiclass-main.py”, 第 27 行,在 X_train_counts=cv.fit_transform(X_train) 文件“...\sklearn\feature_extraction\text.py”,第 1012 行,在 fit_transform self.fixed_vocabulary_) 文件“...sklearn\feature_extraction\text.py”,第 922 行,在 _count_vocab 对于分析(文档)中的功能:文件“...sklearn\feature_extraction\text.py”,第 308 行,在 tokenize(preprocess(self.decode(doc))), stop_words) 文件“...sklearn\feature_extraction\text.py”,第 256 行,在 return lambda x: strip_accents(x.lower()) AttributeError: 'int' object has no attribute 'lower'
如何在这个项目中使用 Tfidf 和 CountVectorizer?
【问题讨论】:
标签: python machine-learning scikit-learn tf-idf