【问题标题】:Does Python provide any libraries for textual relationship?Python 是否提供任何用于文本关系的库?
【发布时间】:2017-09-06 15:49:32
【问题描述】:

我有一个词,让我们说“美国”,还有一个文本文件。我想知道整个文件是否是关于“美国”的。 “美国”这个词在文件中可能会被提及 100 或 1000 次,但到最后,文件可能会谈到中国。

我浏览了 Python 中的情绪分析库,但只有当文档以正面、负面或中立的方式提及该词时,这些库才会返回。

我还可以计算单词被提及的次数,以及单词与文档中每个单词之间的相似度,但仍然不知道如何判断整个文档是否与提到的单词有关。

python 中是否有任何库可以执行此操作,或者任何 API?

【问题讨论】:

标签: python python-2.7 python-3.x text sentiment-analysis


【解决方案1】:

没有任何真正好的完整解决方案库。您可能希望使用 NLTK 之类的东西来进行词干提取和分析 (http://www.nltk.org)。词干如下:“法拉利->跑车->汽车->交通工具”,这可以让你看到一个词的“基础”概念。

然后,您可能需要进行某种 TF/IDF 分析,以确定文档的确切内容。这将帮助您确定哪些词很重要 (http://scikit-learn.org/stable/modules/generated/sklearn.feature_extraction.text.TfidfVectorizer.html)。

关于 TF/IDF 的好教程可以在这里看到:http://stevenloria.com/finding-important-words-in-a-document-using-tf-idf/

【讨论】:

  • 非常感谢,我去看看!
猜你喜欢
  • 1970-01-01
  • 2011-11-12
  • 2010-12-26
  • 2021-06-06
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2022-10-25
  • 2013-11-17
相关资源
最近更新 更多