【问题标题】:clustering semantically related words from a list of words从单词列表中聚类语义相关的单词
【发布时间】:2015-06-22 11:14:06
【问题描述】:

我有一个包含大约 30000 个独特单词的单词列表。
我想根据这些词的相似程度对这个词列表进行分组。 我可以使用这个列表并在 WordNet 的帮助下创建一个本体树吗?

所以基本上我想做的是以某种有意义的方式聚合这些单词以减小列表的大小。
我可以使用什么样的技术来做到这一点?

【问题讨论】:

    标签: nlp semantics word text-mining wordnet


    【解决方案1】:

    您当然可以使用Wordnet 来根据它们的SYNSET 对这些词进行聚类。除了“相同含义”和“相反含义”之外,Wordnet 还包括“部分”关系。遵循单词“啤酒”的这些关系,例如访问所有这些包含同义词集:Brew1、Alcohol1、Drug_of_abuse1、Drug1、Agent3、Substance7、Matter3、Physical_entity1、Entity1、Causal_agent1、Beverage1、Liquid1、Fluid1、Substance1、Part1、Relation1、抽象6,食物1。

    但是......这将取决于您在 Wordnet 中找到多少单词。它不包括动词时态,也没有非常大或非常现代的专有名词集。如果你 30,000 个单词是形容词和名词,它应该做得很好。

    【讨论】:

    • 感谢您的回复。是的,所以就我而言,我的代词主要是人名。名字和姓氏被分隔为两个词,我想将它们组合成一个词。我尝试了一些在线 WordNet 相似性工具,但似乎 WordNet 不是解决方案。但是,如果我可以使用 Wikipedia,那将是一个非常好的解决方案,因为它是最新的。你知道我可以在这里使用的任何基于维基百科的工具吗?
    • 对于专有名词,请尝试 DBPedia 或其他维基百科派生数据集之一。
    猜你喜欢
    • 2017-06-16
    • 2014-07-06
    • 2023-03-29
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多