【发布时间】:2019-06-17 08:42:23
【问题描述】:
我正在使用 sklearn 将文本分类。我正在使用 CountVectorizer 和 TFIDFTransformer 创建稀疏矩阵。
我正在对 CountVectorizer 标记器中使用的 customtokenize_and_stem 函数中的字符串执行几个预处理步骤。
from sklearn.pipeline import Pipeline
from sklearn.svm import LinearSVC
from sklearn.feature_extraction.text import CountVectorizer
from sklearn.feature_extraction.text import TfidfTransformer
SVM = Pipeline([('vect', CountVectorizer(max_features=100000,\
ngram_range= (1, 2),stop_words='english',tokenizer=tokenize_and_stem)),\
('tfidf', TfidfTransformer(use_idf= True)),\
('clf-svm', LinearSVC(C=1)),])
我的问题是,是否有任何简单的方法可以查看/存储 Pipeline 步骤 1/2 的输出以分析进入 svm 的数组类型?
【问题讨论】:
标签: python python-3.x machine-learning scikit-learn