【问题标题】:tfidf oucomes are different for the exact same wordtfidf oucomes 对于完全相同的单词是不同的
【发布时间】:2019-02-14 06:23:03
【问题描述】:

我正在 python 中运行 tfidf 模型。

texts=[**tokenized words**]
dictionary = corpora.Dictionary(texts)
corpus = list(map(dictionary.doc2bow,texts))
test_model = models.TfidfModel(corpus)
corpus_tfidf = test_model[corpus]  

它返回的输出为完全相同的单词提供了一些值模式。 例如,我选择了“AAA”这个词。

         key          score
0       "AAA"       1
2323    "AAA"       0.896502
4086    "AAA"       0.844922 

即使它们完全相同,为什么它们的值却各不相同。

【问题讨论】:

    标签: python pandas gensim tf-idf corpus


    【解决方案1】:

    TFIDF 代表词频逆文档频率。这意味着对于每个文档中的每个标记,TFIDF 矢量化将首先计算文档中标记的频率。然后它会根据其中也有标记的文档的比例对标记频率进行反向加权。

    结果是每个文档中的每个标记都将具有反映其对该特定文档的重要性的值,并因其在所有文档中的存在而负权重。

    一些 TFIDF 处理器还可能根据每个文档中的其他令牌数量添加额外的权重维度。

    简而言之,相同的标记在不同的文档中具有不同的分数,因为该标记可能在某些文档中比其他文档更普遍地出现。这种流行要么是由于它更频繁,要么是由于占文档令牌的更大比例。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2015-04-17
      • 2011-03-14
      • 1970-01-01
      • 1970-01-01
      • 2017-04-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多