【发布时间】:2012-04-02 00:31:23
【问题描述】:
我正在尝试从大量新闻文章中检索主题列表,我计划使用 gensim 使用 LDA 为每个文档提取主题分布。我想知道 gensim 实现 lda 所需的已处理文章的格式以及如何将原始文章转换为该格式。我在维基百科转储上看到了这个关于使用 lda 的链接,但我发现语料库处于处理状态,其格式在任何地方都没有提到
【问题讨论】:
标签: machine-learning lda gensim
我正在尝试从大量新闻文章中检索主题列表,我计划使用 gensim 使用 LDA 为每个文档提取主题分布。我想知道 gensim 实现 lda 所需的已处理文章的格式以及如何将原始文章转换为该格式。我在维基百科转储上看到了这个关于使用 lda 的链接,但我发现语料库处于处理状态,其格式在任何地方都没有提到
【问题讨论】:
标签: machine-learning lda gensim
有一个离线学习步骤和一个在线特征创建步骤。
离线学习
假设您有一个大型语料库,例如 Wikipedia,或者下载了一堆新闻文章。
对于每篇文章/文档:
然后你训练 TF-IDF 模型并将整个语料库转换到 TF-IDF 空间。 最后,在“TF-IDF 语料库”上训练 LDA 模型。
在线
对于收到的新闻文章,您几乎可以做同样的事情:
【讨论】: