【问题标题】:How to package JARs in Spark (Scala) outside of a project?如何在项目外部将 JAR 打包到 Spark (Scala) 中?
【发布时间】:2019-02-11 05:35:13
【问题描述】:

我一直在尝试设置 Spark (Scala) 和 Jupyter 笔记本。 setup is easy 除非您想添加诸如数据库驱动程序之类的东西,尤其是在我的情况下是 redshift,这是一个复杂的 JAR 相互依赖网络,我花了一天时间试图纠正它。

我还安装了 spark localy (Ubuntu 18.04) 并且遇到了同样的问题,找到 /jar 文件夹,然后找出我需要使用哪些版本的驱动程序、库等。

所有这些都是为了在连接到 redshift 的 Jupyter 笔记本中获得火花:@

【问题讨论】:

    标签: java scala apache-spark jupyter-notebook


    【解决方案1】:

    如果您打算将 Scala 用于 Spark,最好设置/使用 Zeppelin 笔记本环境而不是 Jupyter。一旦你让 Zeppelin 工作,创建一个新笔记本,在一个空单元格中,你可以使用 %sh 魔法命令运行 Unix 风格的命令(如 sudo apt-get )来安装你需要的任何其他库。

    【讨论】:

    • 这仍然没有解释我将如何安装 Redshift JDBC 连接器(及其所有依赖项)。您如何管理 Spark 注入的依赖关系?
    • 试试这个:blog.rjmetrics.com/2016/02/08/… 注意,我没有要连接的 Redshift 实例,所以我自己没有尝试过这些步骤,但看起来作者已经列出了这些步骤以易于遵循的指南格式,这应该可以帮助您前进。如果您遇到任何具体问题,可以在此处发布更多详细信息。
    • 是的,这就是 Jupyter 笔记本通过 psycopg2 连接到 Redshift,你很容易,但问题是关于将 Spark 连接到 Redshift 不是一回事。慢一点。阅读问题。
    • 啊,我明白你在追求什么!您想在 Jupyter 笔记本环境中通过 Spark 连接到 Redshift。首先,从docs.aws.amazon.com/redshift/latest/mgmt/… 下载相应的 Redshift 驱动程序 jar。将其保存到您认为合适的任何路径。接下来,使用命令/选项启动 Jupyter Notebook:- bin/pyspark --driver-class-path /path_to_redshift_driver.jar --jars /path_to_redshift_driver.jar 最后,使用此链接中的说明进行连接:- github.com/databricks/spark-redshift#usage
    猜你喜欢
    • 2016-10-17
    • 2019-09-03
    • 2018-12-19
    • 2017-01-21
    • 2015-07-20
    • 1970-01-01
    • 1970-01-01
    • 2012-06-05
    • 2019-02-15
    相关资源
    最近更新 更多