【问题标题】:AWS EMR notebook Spark kernel infinitely loads small JSON fileAWS EMR 笔记本 Spark 内核无限加载小型 JSON 文件
【发布时间】:2020-02-28 03:49:44
【问题描述】:

我正在尝试在带有 Spark 内核的 EMR 笔记本中加载 JSON 文件。我正在使用我以前使用过的一个非常大的、经过验证的 EMR 集群,因此集群大小/计算能力不是问题。下面的简单代码足以重现我的问题:

val df = spark.read.json("s3a://src/main/resources/zipcodes.json")

这是我要加载的 JSON 文件。它非常小。 https://raw.githubusercontent.com/spark-examples/spark-scala-examples/71d2db89ffb24db6f01eb1fa12286bfbb37c44c4/src/main/resources/zipcodes.json

我让它运行了 1 小时。左下角写着:Spark | Busy,右上角的圆圈是满的,表示内核正在工作。但是,Spark Job Progress 显示了一个永不进展的Task Progress 条形图。有什么建议吗?

【问题讨论】:

    标签: json scala apache-spark


    【解决方案1】:

    问题不在于 JSON 文件。为了解决这个问题,我只是用完全相同的步骤/配置克隆了有问题的 EMR 集群,将我的 EMR 笔记本附加到克隆并使用完全相同的文件重新尝试完全相同的代码。它几乎是瞬间起作用的。问题出在原始集群上,虽然我不知道确切的问题是什么。

    【讨论】:

      猜你喜欢
      • 2020-09-09
      • 2020-10-17
      • 1970-01-01
      • 2021-11-26
      • 1970-01-01
      • 1970-01-01
      • 2021-04-29
      • 2018-07-02
      • 1970-01-01
      相关资源
      最近更新 更多