【问题标题】:Large free block of english non-pronoun text大量免费的英文非代词文本
【发布时间】:2010-04-11 17:44:56
【问题描述】:

作为自学python的一部分,我编写了一个脚本,允许用户扮演刽子手。目前,要猜的刽子手词只是在脚本代码的开头手动输入。

我希望脚本从大量英文单词中随机选择。我知道该怎么做 - 我的问题是首先找到要使用的单词列表。

有没有人知道网络上的来源,例如 1000 个常用英语单词,它们可以作为文本块或类似的东西下载,我可以使用?

(我最初的想法是从古腾堡项目中获取一本小说的一部分[这个项目只是为了我自己的娱乐,不会在其他任何地方提供,所以版权等对我来说并不重要],但任何类似的东西可能包含太多不适合刽子手的名称或非标准单词。我需要的文本基本上只有在拼字游戏中合法使用的单词)。

我想这是一个有点奇怪的问题,但实际上我认为这个答案可能不仅对我有用,而且对从事文字游戏或类似项目的其他任何人都有用,需要大量的单词种子列表来工作.

非常感谢任何链接或建议:)

【问题讨论】:

    标签: text seed


    【解决方案1】:

    this 有用吗?

    【讨论】:

      【解决方案2】:

      你试过 /usr/share/dict/words 吗?

      【讨论】:

      • -1 假设他使用 linux,而它的市场份额为 2%。
      • :哦,这真是个好主意。谢谢!编辑:实际上对我来说并不理想,因为里面有很多人的名字、首字母缩写词和其他东西......但它至少暂时会给我一些工作
      【解决方案3】:

      手动创建文本列表

      从古腾堡计划、维基百科或其他来源获取文本。浏览文本并计算找到每个单词的次数。出现频率最高的词是代词、连词等……扔掉吧。

      专有名词可能是最不常见的词,除非您的文本当然是一个故事,那么角色名称很可能会经常出现。处理专有名词的最佳方法可能是使用多个来源并计算该词在多少个来源中找到。本质上,在许多不同来源中常见的词可能不是专有名词。特定于一个文本源的单词,你可以扔掉。这个想法与tfidf有关。

      计算完这些词频后,您还可以轻松查看这些词,并根据需要调整您的列表。

      使用 Wordnet

      另一个想法是从Wordnet 下载单词。 Wordnet 告诉很多单词的词性。你可以只使用名词和动词来达到你的目的。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2016-12-27
        • 1970-01-01
        • 2015-10-01
        • 1970-01-01
        • 2016-09-27
        • 2016-11-07
        • 1970-01-01
        • 2017-05-08
        相关资源
        最近更新 更多