【发布时间】:2018-06-27 19:21:51
【问题描述】:
我不想在集群中运行 spark。使用 spark 的唯一原因是使用 MLlib。简而言之,我需要在我的应用程序中使用 MLlib jar,并且依赖最少。目前,我的 spark 组装 jar 大约 125 MB。有什么办法可以最小化吗?
【问题讨论】:
-
您能描述一下您的设置吗?你使用什么构建工具?您问题中的描述是极简的,它可能导致问题被关闭。
-
我的设置是 tomcat web 应用程序。它为 Spark ML 库提供 REST API。我在 ml 和 mllib 中使用算法。我正在使用 Maven 进行构建。从某种意义上说是极简主义,火花组装 jar 包含可能的依赖项(胖 jar)。我想尽可能减少它,同时仍然可以使用 spark mllib 的。
-
好吧,让我换个说法。你至少有独立的 spark 运行吗?
-
不使用 hadoop 运行它会很棒。
-
目前我正在以独立模式运行 spark-assembly 预构建 jar。
标签: maven apache-spark apache-spark-mllib apache-spark-ml