【发布时间】:2020-02-14 12:10:12
【问题描述】:
我正在尝试计算 TF-IDF 矢量化的 IDF 值。我正在尝试计算包含该词汇的每个唯一单词的文档数。
这是语料库:
corpus = ['这是第一个文档', '这个文件是第二个文件', '这是第三个', '这是第一个文件吗']
我的代码:
...
IDF 值:
for i in range(0,len(corpus)):
o=corpus[i].split(' ')
c=0
for wor in n:
for k in range(0,len(corpus)):
if wor in o[k]:
c=c+1
print(wor, c)
...
我得到的输出: 和 0 文档 0 第一个 1 是 3 一个 3 第二个 3 4 第三个 4 这 5 和 0 文件 1 第一个 1 是 3 一个 3 第二个 3 4 第三个 4 这 5 和 1 文件 1 第一个 1 是 3 一个 3 第二个 3 4 第三个 4 这 5 和 0 文档 0 第一个 1 是 3 一个 3 第二个 3 4 第三个 4 这5
我需要的输出: 这 4 是 4 4 前 2 文件 3 第二个 1 和 1 第三个 1 一个 1
【问题讨论】: