【问题标题】:Explain the connection between spark libraries, such as SparkSQL, MLib, GraphX and Spark Streaming解释 Spark 库之间的连接,例如 SparkSQL、MLib、GraphX 和 Spark Streaming
【发布时间】:2018-05-07 16:03:01
【问题描述】:

说明 SparkSQL、MLib、GraphX 和 Spark Streaming 等库与核心 Spark 平台之间的联系

【问题讨论】:

    标签: apache-spark apache-spark-sql spark-dataframe spark-streaming spark-graphx


    【解决方案1】:

    从根本上说,Spark 是基础,是一个允许大规模数据处理的高性能引擎。它为具有隐式数据并行性和容错性的编程提供了一个接口。

    GraphX、MLlib、Spark Streaming 和 Spark SQL 是构建在这个引擎之上的模块,每个模块都有一个不同的目标。这些库中的每一个都有新的对象和函数,它们为某些类型的结构或特性提供支持。

    例如:

    • GraphX 是一个分布式图形处理模块,它允许表示图形并应用专门针对这种结构的有效转换、分区和算法。
    • MLlib 是 Spark 之上的分布式机器学习模块,它实现了某些算法,例如分类、回归、聚类……
    • Spark SQL 引入了 DataFrames 的概念,这是该模块中最重要的结构,它允许应用 SQL 操作(例如 selectwhere , groupBy, ...)
    • Spark Streaming 是核心 Spark 的扩展,它以 mini-batches 的形式摄取数据,并对这些 mini-batches 数据执行转换。 Spark Streaming 已内置支持从 Kafka、Flume 和其他平台消费

    您可以根据需要组合这些模块。例如,如果您想处理一个大图以应用聚类算法,那么您可以使用 GraphX 提供的表示并使用 MLlib 在此上应用 K-means表示。

    Doc

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2014-10-14
      • 2017-03-09
      • 2021-03-14
      • 1970-01-01
      • 2016-01-25
      • 1970-01-01
      • 2019-04-15
      相关资源
      最近更新 更多