【问题标题】:Using Scala kernel with Spark在 Spark 中使用 Scala 内核
【发布时间】:2020-08-09 00:20:03
【问题描述】:

我在从 Spark 访问 S3 数据时遇到问题。 我为JupyterHub 安装了spylon-kernel(这是带有Spark 框架集成的Scala 内核)。它使用pyspark。 不幸的是,最新的 pyspark 仍然使用 hadoop-2.7.3 库。当我尝试访问法兰克福地区的 S3 存储桶时,出现以下 Java 异常:

com.amazonaws.services.s3.model.AmazonS3Exception:状态代码:400, AWS 服务:Amazon S3,AWS 请求 ID:xxxxxxxxxx,AWS 错误代码: null,AWS 错误消息:错误请求"

根据我的研究,这似乎是hadoop 2.7.3 问题。对于较新的版本(3.1.1),它在本地运行良好,但pyspark 使用那些hadoop 2.7.3 jar 并且看起来无法更改。我能做点什么吗?也许有一些方法可以告诉pyspark 使用hadoop 3.1.1 罐子?或者也许还有其他带有 Spark for Jupyterhub 的 Scala 内核,它使用 spark-shell 而不是 pyspark

【问题讨论】:

    标签: java scala hadoop amazon-s3 pyspark


    【解决方案1】:

    好的,我终于修好了...我会发布一个答案,也许它会对某人有用。

    pip install toree
    
    jupyter toree install --spark_home /path/to/your/spark/ --interpreters=Scala
    

    这个有效! :)

    【讨论】:

      猜你喜欢
      • 2016-07-17
      • 1970-01-01
      • 1970-01-01
      • 2016-12-04
      • 2018-09-07
      • 2021-12-26
      • 2023-03-11
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多