【发布时间】:2017-07-04 11:05:36
【问题描述】:
借助 Python 的 scikit-learn 包中的 TfidfVectorizer,我们可以轻松地将文档列表转换为具有 <term>-frequency-inverse-document-frequency 特征的数据集,其中 terms 是文档中出现的单词。
在 Python 中的任何地方是否有 TfidfVectorizer 的 TfVectorizer 类比,它会产生 <term>-frequency 特征,即我们不会通过逆文档频率对特征的值进行加权?
比起用其他编程语言编写的解决方案,我更喜欢 Python 解决方案,但如果您知道任何易于使用的 Java 实现,也可以提及。
【问题讨论】:
标签: python scikit-learn tf-idf