【问题标题】:Get Automatic Topic Labels from LDA topic model in Apache Spark从 Apache Spark 中的 LDA 主题模型获取自动主题标签
【发布时间】:2018-09-11 19:37:25
【问题描述】:

我正在 Apache-Spark 中进行主题建模,以便从非结构化数据中对某些产品进行分类。

到目前为止,我已经应用了主题建模 (LDA) 并获取了主题,但我想知道是否有任何方法可以从 LDA 给出的主题中自动推断主题标签。

【问题讨论】:

    标签: apache-spark nlp apache-spark-ml apache-spark-dataset


    【解决方案1】:

    LDA 返回字典中每个术语的概率分布,以表示特定主题。如果您在 LDAModel 上调用 describeTopics(n),您会收到一个 DataFrame,其中包含每个主题的术语权重到术语索引的映射。

    如果您需要推断主题标签,我假设您希望获得最能代表特定主题的人类可读术语。但是,没有直接的方法可以免费从LDAModel 获取此信息。相反,您需要在上面调用describeTopics,然后用您的字典压缩术语索引。

    【讨论】:

    • 你说的我已经完成了,现在我想要的是为LDA生成的Topic词获取一个特定的标签。
    • 我不确定我是否正确理解了您的问题。你已经获得了最能代表一个话题的词语?现在你需要什么样的标签?您能否改写您的问题并发布您的代码。
    • 基本上我需要对看不见的文档进行分类。在主题建模之后,我需要为特定主题的主题术语分配某些标签,以便我可以根据该标签对文档进行分类。代码已发布。
    • 如果您想通过训练有素的 LDAModel 对新文档进行分类,只需通过管道模型使用新实例转换数据框即可。
    • 嘿,我想知道你是否还在这里。我正在考虑将主题模型中的单词作为特征并训练分类模型,然后以某种方式将测试数据的主题词传递给该分类模型并获得结果。
    猜你喜欢
    • 2012-03-25
    • 1970-01-01
    • 2021-05-12
    • 1970-01-01
    • 1970-01-01
    • 2015-11-15
    • 2021-01-06
    • 2020-11-23
    • 1970-01-01
    相关资源
    最近更新 更多