【发布时间】:2019-04-17 14:53:33
【问题描述】:
所以,我正在做一个任务,我被困在这部分。我有一个字典,其中包含一个字符串元组作为键和相应的值。现在我必须通过使用 paras 方法删除布朗语料库文档中出现次数少于 8 次的键来过滤字典
我到处寻找它,但找不到任何关于如何做到这一点的伪代码。
[{('love', 'sex'): '6.77',
('tiger', 'cat'): '7.35',
('tiger', 'tiger'): '10.00',
('book', 'paper'): '7.46',
('computer', 'keyboard'): '7.62',
('computer', 'internet'): '7.58',
('plane', 'car'): '5.77',
('train', 'car'): '6.31',
('telephone', 'communication'): '7.50',
('television', 'radio'): '6.77',
('media', 'radio'): '7.42',
('drug', 'abuse'): '6.85',
.
.
.
所以我对这本字典要做的是,我应该删除键,其标记(单词对)不是按字母顺序排列的,以及至少一个单词有文档的单词对(键)棕色语料库中低于8的频率
【问题讨论】:
-
我可以为您提供帮助,但您能否提供一个(或几个)示例输入和示例输出,也涵盖边缘情况?我宁愿不必深入研究“棕色语料库”和“文档频率”的定义......
-
@Error-SyntacticalRemorse 我不明白边缘情况下的输入/输出是什么意思。
-
不要介意边缘情况。提供足够详细的示例输入,以满足您的需求,并为该输入提供您想要的输出。
-
@Error-SyntacticalRemorse 输入是您在问题中看到的字典。它有153个整体。所以,我要做的是删除单词对(键)不是按字母顺序排列的条目。然后,我必须计算文档集合(布朗语料库)中每个单词(不是单词对,单个单词)的文档频率,并删除单词对中至少一个单词具有文档频率的键小于 8
标签: python-3.x nltk corpus