【发布时间】:2020-11-15 13:16:48
【问题描述】:
有人可以帮我解决这个问题并解释如何正确标记、计数和循环吗?有这样的任务要做:
- 创建一个新的空字典
dic = {} - 遍历
text1中包含的标记,并计算它们在该列表中出现的原始频率。 'to be or not to be'中'to'的'原始频率'是2。最后,当你遍历所有标记时...... - 打印一组区分大小写的唯一标记(即类型)及其各自的频率,格式为:
COUNTER UNIQUE_TOKEN FREQUENCY NEWLINE- 按唯一标记的频率排序 - L对不区分大小写的唯一标记重复步骤
*Text1 来自 nltkbook
到目前为止得到了这个,但是奇怪的事情正在发生,我完全不明白我做了什么:(
import nltk
from nltk.book import *
print(len(set(text1)))
counter = 0
for token in text1:
counter += 1
print(counter)
将非常感谢任何帮助、线索、建议。
【问题讨论】:
-
您要检查文本的“令牌”(子字符串)列表是什么?
-
如果我理解正确,大写和小写字母
标签: python dictionary nltk tokenize