【发布时间】:2016-07-27 02:46:17
【问题描述】:
我知道在 NLP 中,确定一个句子或可能是一个段落的主题是一项挑战。但是,我正在尝试确定 Wikipedia 文章之类的标题可能是什么(当然不使用其他方法)。我唯一的办法是找到最常用的词。对于有关纽约市的文章,这些是最佳结果:
[('new', 429), ('city', 380), ('york', 361), ("'s", 177), ('manhattan', 90), ('world', 84), ('united', 78), ('states', 74), ('===', 70), ('island', 68), ('largest', 66), ('park', 64), ('also', 56), ('area', 52), ('american', 49)]
从这里我可以看到某种统计意义是从 361 急剧下降到 177。无论如何,我既不是统计专家,也不是 NLP 专家(事实上我在这两个方面都是菜鸟)所以 这是一种确定较长正文主题的可行方法。如果是这样,我在寻找什么数学来计算这个?如果没有,NLP 中是否有其他方法可以确定更大正文的主题或标题? 作为参考,我使用的是 nltk 和 Python 3。
【问题讨论】:
标签: python python-3.x nlp nltk