【发布时间】:2015-06-22 11:14:06
【问题描述】:
我有一个包含大约 30000 个独特单词的单词列表。
我想根据这些词的相似程度对这个词列表进行分组。
我可以使用这个列表并在 WordNet 的帮助下创建一个本体树吗?
所以基本上我想做的是以某种有意义的方式聚合这些单词以减小列表的大小。
我可以使用什么样的技术来做到这一点?
【问题讨论】:
标签: nlp semantics word text-mining wordnet
我有一个包含大约 30000 个独特单词的单词列表。
我想根据这些词的相似程度对这个词列表进行分组。
我可以使用这个列表并在 WordNet 的帮助下创建一个本体树吗?
所以基本上我想做的是以某种有意义的方式聚合这些单词以减小列表的大小。
我可以使用什么样的技术来做到这一点?
【问题讨论】:
标签: nlp semantics word text-mining wordnet
您当然可以使用Wordnet 来根据它们的SYNSET 对这些词进行聚类。除了“相同含义”和“相反含义”之外,Wordnet 还包括“部分”关系。遵循单词“啤酒”的这些关系,例如访问所有这些包含同义词集:Brew1、Alcohol1、Drug_of_abuse1、Drug1、Agent3、Substance7、Matter3、Physical_entity1、Entity1、Causal_agent1、Beverage1、Liquid1、Fluid1、Substance1、Part1、Relation1、抽象6,食物1。
但是......这将取决于您在 Wordnet 中找到多少单词。它不包括动词时态,也没有非常大或非常现代的专有名词集。如果你 30,000 个单词是形容词和名词,它应该做得很好。
【讨论】: