【发布时间】:2018-05-25 04:30:09
【问题描述】:
我在 countvectorized 数据框中有大约 2000 个文本特征。我有 800 个文本特征列的列表,它们对预测模型具有实际的特征重要性贡献。我只想保留这 800 列并删除其余 1200 列,因为它们对我的预测贡献不大。
我该怎么做。我有要在文本文件中维护的列列表。
cv = CountVectorizer( max_features = 2000,analyzer='word')
cv_text = cv.fit_transform(data.pop('text'))
for i, col in enumerate(cv.get_feature_names()):
data[col] = pd.SparseSeries(cv_text[:, i].toarray().ravel(), fill_value=0)
【问题讨论】:
标签: python pandas scikit-learn nlp