【问题标题】:counting tokens and types + dictionaries计数标记和类型 + 字典
【发布时间】:2020-11-15 13:16:48
【问题描述】:

有人可以帮我解决这个问题并解释如何正确标记、计数和循环吗?有这样的任务要做:

  1. 创建一个新的空字典dic = {}
  2. 遍历text1 中包含的标记,并计算它们在该列表中出现的原始频率。 'to be or not to be'中'to'的'原始频率'是2。最后,当你遍历所有标记时......
  3. 打印一组区分大小写的唯一标记(即类型)及其各自的频率,格式为:COUNTER UNIQUE_TOKEN FREQUENCY NEWLINE - 按唯一标记的频率排序
  4. L对不区分大小写的唯一标记重复步骤

*Text1 来自 nltkbook

到目前为止得到了这个,但是奇怪的事情正在发生,我完全不明白我做了什么:(

    import nltk
    from nltk.book import *
    print(len(set(text1)))
    counter = 0
       for token in text1:
       counter += 1
    print(counter)

将非常感谢任何帮助、线索、建议。

【问题讨论】:

  • 您要检查文本的“令牌”(子字符串)列表是什么?
  • 如果我理解正确,大写和小写字母

标签: python dictionary nltk tokenize


【解决方案1】:

例如,这是如何执行此操作的示例

text = "to be or not to be"
token = ["to", "or"]

my_dict = {sub:text.count(sub) for sub in token}

print(my_dict)

给你

{'to': 2, 'or': 1}

【讨论】:

    猜你喜欢
    • 2017-06-03
    • 1970-01-01
    • 2012-03-11
    • 1970-01-01
    • 1970-01-01
    • 2023-04-06
    • 2016-04-11
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多