【发布时间】:2020-08-09 00:20:03
【问题描述】:
我在从 Spark 访问 S3 数据时遇到问题。
我为JupyterHub 安装了spylon-kernel(这是带有Spark 框架集成的Scala 内核)。它使用pyspark。
不幸的是,最新的 pyspark 仍然使用 hadoop-2.7.3 库。当我尝试访问法兰克福地区的 S3 存储桶时,出现以下 Java 异常:
“com.amazonaws.services.s3.model.AmazonS3Exception:状态代码:400, AWS 服务:Amazon S3,AWS 请求 ID:xxxxxxxxxx,AWS 错误代码: null,AWS 错误消息:错误请求"
根据我的研究,这似乎是hadoop 2.7.3 问题。对于较新的版本(3.1.1),它在本地运行良好,但pyspark 使用那些hadoop 2.7.3 jar 并且看起来无法更改。我能做点什么吗?也许有一些方法可以告诉pyspark 使用hadoop 3.1.1 罐子?或者也许还有其他带有 Spark for Jupyterhub 的 Scala 内核,它使用 spark-shell 而不是 pyspark?
【问题讨论】:
标签: java scala hadoop amazon-s3 pyspark