【问题标题】:How to use gensim for lda on news articles?如何在新闻文章中使用 gensim for lda?
【发布时间】:2012-04-02 00:31:23
【问题描述】:

我正在尝试从大量新闻文章中检索主题列表,我计划使用 gensim 使用 LDA 为每个文档提取主题分布。我想知道 gensim 实现 lda 所需的已处理文章的格式以及如何将原始文章转换为该格式。我在维基百科转储上看到了这个关于使用 lda 的链接,但我发现语料库处于处理状态,其格式在任何地方都没有提到

【问题讨论】:

    标签: machine-learning lda gensim


    【解决方案1】:

    我不知道我的问题是否正确,但 gensim 支持多个语料库。你可以找到他们的列表here

    如果要处理自然语言,则必须先对文本进行标记。您可以按照 gensim 网站here 上的分步教程进行操作。解释的很好。

    【讨论】:

      【解决方案2】:

      有一个离线学习步骤和一个在线特征创建步骤。

      离线学习

      假设您有一个大型语料库,例如 Wikipedia,或者下载了一堆新闻文章。

      对于每篇文章/文档:

      1. 你得到原始文本
      2. 您对其进行词形还原。 Gensim 有 utils.lemmatize
      3. 你创建一个字典
      4. 您创建了一个单词表示袋

      然后你训练 TF-IDF 模型并将整个语料库转换到 TF-IDF 空间。 最后,在“TF-IDF 语料库”上训练 LDA 模型。

      在线

      对于收到的新闻文章,您几乎可以做同样的事情:

      1. 词形化
      2. 使用字典创建一个词袋。
      3. 使用 TF-IDF 模型将其转换为 TF-IDF 空间
      4. 将其转换为 LDA 空间。

      【讨论】:

      • 你能说,如何从lda空间转换回正常,我不明白。
      • 您的意思是您在一个文档上拥有主题分布,并希望将文档放在 TF-IDF 空间中?
      猜你喜欢
      • 1970-01-01
      • 2017-06-15
      • 1970-01-01
      • 2017-01-27
      • 1970-01-01
      • 2022-11-19
      • 2015-02-12
      • 2014-10-03
      • 1970-01-01
      相关资源
      最近更新 更多