【发布时间】:2019-12-10 21:16:11
【问题描述】:
我有一份清单
x=["hello there","hello world","my name is john"]
我已经完成了 TF-IDF 的矢量化
这是 TF-idf 的输出
from sklearn.feature_extraction.text import TfidfVectorizer
corpus = [
"hello there","hello world","my name is john", ]
vectorizer = TfidfVectorizer()
X = vectorizer.fit_transform(corpus)
X.toarray()
array([[0.60534851, 0. , 0. , 0. , 0. ,
0.79596054, 0. ],
[0.60534851, 0. , 0. , 0. , 0. ,
0. , 0.79596054],
[0. , 0.5 , 0.5 , 0.5 , 0.5 ,
0. , 0. ]])
我们可以找到每个句子的权重(与所有文档进行比较)吗?
如果是,那么如何?
【问题讨论】:
-
你能分享完整的代码并解释一下 TF-idf 的想法是什么吗?
-
是的,做到了,看看@Anteino
-
好的,等我安装这些库并弄清楚 TF-idf 是如何工作的。
-
你能解释一下每句话的权重是什么意思吗?你的意思是那个句子中所有单词的附加权重吗?还是您想在另一个文档中找到这些完整的句子?
-
@Anteino 我想做类似
Page rankinglike 之类的事情(句子1 很有可能是这样的)
标签: python machine-learning scikit-learn