【问题标题】:use scikit learn tfidf vectorizer starting from counts data frame使用 scikit 从计数数据帧开始学习 tfidf 矢量化器
【发布时间】:2015-04-15 03:57:02
【问题描述】:

我有一个 pandas 数据框,其中包含一系列文档的字数。我可以对其应用sklearn.feature_extraction.text.TfidfVectorizer 以返回术语文档矩阵吗?

import pandas as pd

a = [1,2,3,4]
b = [1,3,4,6]
c = [3,4,6,1]

df = pd.DataFrame([a,b,c])

如何在 df 中获取 tfidf 版本的计数?

【问题讨论】:

    标签: python nlp scikit-learn tf-idf


    【解决方案1】:

    像这样:

    from sklearn.feature_extraction.text import TfidfTransformer
    tfidf =TfidfTransformer(norm=u'l2', use_idf=True, smooth_idf=True, sublinear_tf=False)
    data =tfidf.fit_transform(df.values)
    

    这将返回 tfidf 值的稀疏矩阵。你可以把它们变成一个稠密的,然后把它们放回这样的数据框中:

    pd.DataFrame(data.todense())
    

    【讨论】:

      猜你喜欢
      • 2019-06-09
      • 2020-05-07
      • 2021-01-23
      • 2014-11-15
      • 2018-06-04
      • 1970-01-01
      • 2017-12-11
      • 2016-11-27
      • 2014-04-20
      相关资源
      最近更新 更多