【问题标题】:Determine a category from keywords根据关键字确定类别
【发布时间】:2016-01-13 17:36:35
【问题描述】:

在聚类过程之后,我有一堆有一些相似性的词。我想对这些词进行分类。

例如,如果我有这样的话:

  • 关联数据
  • 领域本体语义网
  • 用例
  • 语义标注

也许正确的类别是语义网。

我知道这类问题可以通过 NLP 解决,但我是 NLP 新手,不知道从哪里开始。任何人都可以告诉我正确的方法是什么?或者如果它可以到达?

注意:我发现他们已经通过搭配和词性标注解决了类似的问题。我可以将它应用于这个特定的问题吗?

【问题讨论】:

    标签: nlp


    【解决方案1】:

    您可以搜索有关主题标签的论文 - 这通常被认为是一个非常困难的问题。不过,像下面这样的论文可能是一个不错的起点。作者还有其他一些相关的。

    Lau, J. H.、Grieser, K.、Newman, D. 和 Baldwin, T.(2011 年 6 月)。主题模型的自动标记。在计算语言学协会第 49 届年会论文集上:人类语言技术-第 1 卷(第 1536-1545 页)。计算语言学协会。

    【讨论】:

    • 嗯,不完全是主题模型的规范参考,但非常适合阅读主题模型!
    • 我认为主题模型的规范参考是:cs.princeton.edu/~blei/topicmodeling.html
    • @Marc Tomlinson 谢谢,绝对值得一读。我太喜欢读那篇论文了。我想做那个实验,并为自己尝试这个结果。如果有人想阅读,我会给出论文的链接:aclweb.org/anthology/P11-1154
    • @alvas 这个站点有很多关于主题模型的信息。我想用我的主题术语尝试 LDA 并查看它的行为,因为我没有文档。我有一些关键字,我想为这些关键字关联一个标签。我发现 Apache Mahout 有 LDA。所以我会开始玩它。感谢您的建议,如果您有任何其他建议,我将不胜感激。
    • @alvas 我使用折叠变分贝叶斯算法执行 LDA。我使用了一个集群,该集群是由于另一个过程而获得的。我将论文中的所有关键词和标题作为我的输入数据。之后我得到了一些类别标签,但我想丰富我的结果。那么我可以用维基百科转储来做到这一点,我怎么能做到这一点?因为在“主题模型的自动标记”一文中,他们尝试了这一点,并取得了令人难以置信的结果。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-06-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-02-13
    相关资源
    最近更新 更多