【问题标题】:How to do text analysis in Spark如何在 Spark 中进行文本分析
【发布时间】:2015-05-04 17:25:42
【问题描述】:

我对 Hadoop 非常熟悉,但对 Apache Spark 完全陌生。目前我正在使用 Mahout 中实现的 LDA(潜在狄利克雷分配)算法来进行主题发现。但是,由于我需要使过程更快,我想使用 spark,但是在 Spark MLib 中没有实现 LDA(或 CVB)算法。这是否意味着我必须自己从头开始实现它?如果是这样,Spark 是否提供了一些工具来简化它?

【问题讨论】:

    标签: hadoop apache-spark mapreduce apache-spark-mllib


    【解决方案1】:

    关于如何使用1.3新的Spark LDA API:

    这是一篇描述新 API 的文章:Topic modeling with LDA: MLlib meets GraphX

    并且,它链接到显示如何矢量化文本输入的示例代码:Github LDA Example

    【讨论】:

      【解决方案2】:

      实际上 Spark 1.3.0 现已推出,所以 LDA 可用!!

      参考https://issues.apache.org/jira/browse/SPARK-1405

      问候,

      【讨论】:

        【解决方案3】:

        LDA 最近已添加到 Spark。它不是当前 1.2.1 版本的一部分。

        不过,您可以在当前的 SNAPSHOT 版本中找到一个示例:LDAExample.scala

        您还可以阅读有关SPARK-1405 issue 的有趣信息。


        那我该如何使用呢?

        未发布时最简单的方法可能是在您的项目中复制以下类,就像您自己编写代码一样:

        【讨论】:

        • 谢谢。那么如果它不是当前版本(1.2.1)的一部分,我怎么能使用它呢?
        • 谢谢,Java类还没写好?
        • LDA 在 Spark 1.3 中正式发布,但是文档中的示例假设文档已经被矢量化。我们如何获取实际的 txt 文件并使用 Spark 将它们制作成矢量化格式以提供给 LDA?
        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2016-08-22
        • 2021-12-15
        • 2015-06-04
        • 2012-11-01
        • 2013-08-16
        • 1970-01-01
        相关资源
        最近更新 更多