【发布时间】:2017-11-11 01:00:09
【问题描述】:
我目前正在使用以下代码。我已经为所有文档存储了 tfidf 矩阵,现在我需要特定文档的前 n 个单词吗? 我不知道如何获得它?
这是我目前使用的代码。我现在需要从每个 tfidf 最高的文档中找到单词
import glob
import pandas as pd
import math
filenames=[]
corpus = []
df=pd.DataFrame(columns=['article','similar','score'])
for file in glob.glob("*.txt"):
with open(file, "r") as paper:
corpus.append((file, paper.read()))
filenames.append(file)
from sklearn.feature_extraction.text import TfidfVectorizer
tf = TfidfVectorizer(analyzer='word', ngram_range=(1,1), min_df = 0, stop_words = 'english')
tfidf_matrix = tf.fit_transform([content for file, content in corpus])
【问题讨论】:
标签: python-2.7 pandas tf-idf