【发布时间】:2017-12-01 07:14:37
【问题描述】:
我有一个可能很愚蠢的问题;实际上,我在本地运行 Spark 时已解决此问题,但在 AWS EMR 上运行时无法解决。
基本上,我提交了一个 pyspark 脚本,它读取数据、对其进行操作、将其处理为 Spark Dataframe 并将其写入我已在 AWS RDS 上其他地方托管的 MySQL 表中。
这是 EMR 5.6,带有 Spark 2.1.1
我下载了 MySQL 连接器的最新驱动程序(“mysql-connector-java-5.1.42-bin.jar”)并将它们与主节点一起放入我的实例中(基本上将其下载到我的本地笔记本电脑上,然后使用 scp放在主节点中)。
然后我在 /etc/spark/conf 下找到了我的 spark-defaults.conf 文件并编辑了以下参数:
spark.driver.extraClassPath
spark.executor.extraClassPath
对于这两个,我添加了 mysql-connector 文件的路径,该文件位于 /home/hadoop/mysql-connector-java-5.1.42-bin.jar
基于此 SO 帖子 (Adding JDBC driver to Spark on EMR),我使用以下命令提交(包括“extraClassPath”的整个路径):
spark-submit sample_script.py --driver-class-path /home/hadoop/mysql-connector-java-5.1.42-bin.jar:/usr/lib/hadoop-lzo/lib/*:/usr/lib/hadoop/hadoop-aws.jar:/usr/share/aws/aws-java-sdk/*:/usr/share/aws/emr/emrfs/conf:/usr/share/aws/emr/emrfs/lib/*:/usr/share/aws/emr/emrfs/auxlib/*:/usr/share/aws/emr/security/conf:/usr/share/aws/emr/security/lib/*
在我的代码中,我有一个 spark 数据框,以下代码是写入数据库的内容:
SQL_CONN = "jdbc:mysql://name.address.amazonaws.com:8000/dbname?user=user&password=pwd"
spark_df.write.jdbc(SQL_CONN, table="tablename", mode="append", properties={"driver":'com.mysql.jdbc.Driver'})
我得到的具体错误是这样的:
java.lang.ClassNotFoundException (com.mysql.jdbc.Driver) [duplicate 51]
任何意见都将不胜感激......这对我来说是一个非常愚蠢的错误,我无法确定。
【问题讨论】:
-
{"driver":'com.mysql.jdbc.Driver'}这里不应该是双引号吗?与问题无关。我会首先检查运行spark-submit的用户是否可以访问给定的类路径路径,然后我会检查日志(无论它们在哪里)是否真的加载了这些类路径 -
我认为实际上是因为我的从节点没有 jar 文件。让我快点试试。
标签: mysql apache-spark jdbc pyspark emr