【问题标题】:Building Apache spark Mllib with dependencies使用依赖项构建 Apache spark Mllib
【发布时间】:2018-06-27 19:21:51
【问题描述】:

我不想在集群中运行 spark。使用 spark 的唯一原因是使用 MLlib。简而言之,我需要在我的应用程序中使用 MLlib jar,并且依赖最少。目前,我的 spark 组装 jar 大约 125 MB。有什么办法可以最小化吗?

【问题讨论】:

  • 您能描述一下您的设置吗?你使用什么构建工具?您问题中的描述是极简的,它可能导致问题被关闭。
  • 我的设置是 tomcat web 应用程序。它为 Spark ML 库提供 REST API。我在 ml 和 mllib 中使用算法。我正在使用 Maven 进行构建。从某种意义上说是极简主义,火花组装 jar 包含可能的依赖项(胖 jar)。我想尽可能减少它,同时仍然可以使用 spark mllib 的。
  • 好吧,让我换个说法。你至少有独立的 spark 运行吗?
  • 不使用 hadoop 运行它会很棒。
  • 目前我正在以独立模式运行 spark-assembly 预构建 jar。

标签: maven apache-spark apache-spark-mllib apache-spark-ml


【解决方案1】:

根据应用程序的使用方式,您可以将依赖项标记为已提供,这将减少 jar 的大小,因此部署速度会更快。

另外,您检查 maven 程序集是否在 jar 中也包含 Scala 标准库(sbt assembly 默认包含 Scala 标准库)

【讨论】:

  • 我无法明确找到 spark mllib 的依赖项。 scala stdlib 也包含在目标 jar 中。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2016-03-07
  • 2017-07-25
  • 2018-02-17
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多