【发布时间】:2020-02-28 03:49:44
【问题描述】:
我正在尝试在带有 Spark 内核的 EMR 笔记本中加载 JSON 文件。我正在使用我以前使用过的一个非常大的、经过验证的 EMR 集群,因此集群大小/计算能力不是问题。下面的简单代码足以重现我的问题:
val df = spark.read.json("s3a://src/main/resources/zipcodes.json")
这是我要加载的 JSON 文件。它非常小。 https://raw.githubusercontent.com/spark-examples/spark-scala-examples/71d2db89ffb24db6f01eb1fa12286bfbb37c44c4/src/main/resources/zipcodes.json
我让它运行了 1 小时。左下角写着:Spark | Busy,右上角的圆圈是满的,表示内核正在工作。但是,Spark Job Progress 显示了一个永不进展的Task Progress 条形图。有什么建议吗?
【问题讨论】:
标签: json scala apache-spark