【发布时间】:2020-10-29 21:23:38
【问题描述】:
下面是我正在为文本分类模型尝试的代码;
from sklearn.feature_extraction.text import TfidfVectorizer
ifidf_vectorizer = TfidfVectorizer()
X_train_tfidf = ifidf_vectorizer.fit_transform(X_train)
X_train_tfidf.shape
(3, 16)
from sklearn.svm import LinearSVC
clf = LinearSVC()
clf.fit(X_train_tfidf,y_train)
到目前为止,只有训练集被向量化为完整的词汇表。为了对测试集进行分析,我需要将其提交给相同的程序。 所以我做到了
X_test_tfidf = ifidf_vectorizer.fit_transform(X_test)
X_test_tfidf.shape
(2, 12)
最后在尝试预测其显示错误时;
predictions = clf.predict(X_test_tfidf)
ValueError: X has 12 features per sample; expecting 16
但是当我使用管道from sklearn.pipeline import Pipeline 时,它工作正常;
我不能按照我尝试的方式编码吗?
【问题讨论】:
标签: python machine-learning scikit-learn text-classification