【发布时间】:2021-09-22 16:11:26
【问题描述】:
我希望从不同的数据块实例连接到一个数据块实例中的增量湖。我已经从下载page 下载了 sparksimba jar。当我使用以下代码时:
result = spark.read.format("jdbc").option('user', 'token').option('password', <password>).option('query', query).option("url", <url>).option('driver','com.simba.spark.jdbc42.Driver').load()
我收到以下错误:
Py4JJavaError: An error occurred while calling o287.load.: java.lang.ClassNotFoundException: com.simba.spark.jdbc42.Driver
从周围阅读看来我需要注册驱动程序类路径,但我找不到可行的方法。
我尝试了以下代码,但我的 databricks env 中不存在 bin/pyspark 目录:
%sh bin/pyspark --driver-class-path $/dbfs/driver/simbaspark/simbaspark.jar --jars /dbfs/driver/simbaspark/simbaspark.jar
我也试过了:
java -jar /dbfs/driver/simbaspark/simbaspark.jar
但我得到了这个错误:在 dbfs/driver/simbaspark/simbaspark 中没有主清单属性
【问题讨论】:
-
您将文件存储在哪里(dbfs 或数据湖 v1/v2)
-
文件存储在dbfs中
-
感觉更好的解决方案是迁移到数据湖
-
我在一家公司工作,但没有选择这样做。
标签: python jdbc pyspark databricks azure-databricks