【发布时间】:2018-10-10 15:32:39
【问题描述】:
我在virtualenv 上运行Python-3.x,尝试使用nltk 处理文本。
我看到了这篇帖子What are ngram counts...,最受好评的答案有一些使用count() 方法的代码。但是当我将其复制/粘贴到我的时:
import nltk
from nltk import bigrams
from nltk import trigrams
text="""Lorem ipsum dolor sit amet, consectetur adipiscing elit. Nullam ornare
tempor lacus, quis pellentesque diam tempus vitae. Morbi justo mauris,
congue sit amet imperdiet ipsum dolor sit amet, consectetur adipiscing elit. Nullam ornare
tempor lacus, quis pellentesque diam"""
tokens = nltk.word_tokenize(text)
tokens = [token.lower() for token in tokens if len(token) > 1]
bi_tokens = bigrams(tokens)
tri_tokens = trigrams(tokens)
print [(item, tri_tokens.count(item)) for item in sorted(set(tri_tokens))]
我收到这条消息:
AttributeError: 'generator' object has no attribute 'count'
我在monkeypatch 上看到this other post 用于计数方法,但感觉这与某种方式无关。知道我可能做错了什么吗?
【问题讨论】:
标签: python count nlp nltk n-gram