【发布时间】:2018-09-11 19:37:25
【问题描述】:
我正在 Apache-Spark 中进行主题建模,以便从非结构化数据中对某些产品进行分类。
到目前为止,我已经应用了主题建模 (LDA) 并获取了主题,但我想知道是否有任何方法可以从 LDA 给出的主题中自动推断主题标签。
【问题讨论】:
标签: apache-spark nlp apache-spark-ml apache-spark-dataset
我正在 Apache-Spark 中进行主题建模,以便从非结构化数据中对某些产品进行分类。
到目前为止,我已经应用了主题建模 (LDA) 并获取了主题,但我想知道是否有任何方法可以从 LDA 给出的主题中自动推断主题标签。
【问题讨论】:
标签: apache-spark nlp apache-spark-ml apache-spark-dataset
LDA 返回字典中每个术语的概率分布,以表示特定主题。如果您在 LDAModel 上调用 describeTopics(n),您会收到一个 DataFrame,其中包含每个主题的术语权重到术语索引的映射。
如果您需要推断主题标签,我假设您希望获得最能代表特定主题的人类可读术语。但是,没有直接的方法可以免费从LDAModel 获取此信息。相反,您需要在上面调用describeTopics,然后用您的字典压缩术语索引。
【讨论】: