【发布时间】:2020-01-23 13:06:50
【问题描述】:
我打开了一个 AWS EMR 集群,并在 pyspark3 jupyter notebook 中运行以下代码:
"..
textRdd = sparkDF.select(textColName).rdd.flatMap(lambda x: x)
textRdd.collect().show()
.."
我收到了这个错误:
An error was encountered:
Invalid status code '400' from http://..../sessions/4/statements/7 with error payload: {"msg":"requirement failed: Session isn't active."}
跑线:
sparkDF.show()
有效!
我还创建了文件的一小部分,我的所有代码都运行良好。
有什么问题?
【问题讨论】:
-
稍等片刻,笔记本会创建与 EMR 的会话或重新启动内核。我认为只是超时
-
集群现在开了两个小时,我需要等多久?为什么我不需要等待小子集?
-
不是集群,而是您的笔记本。检查您的 EMR 的应用程序日志,确认笔记本的 livy 会话运行良好。
-
如何检查?
-
您的 EMR 控制台 > 应用程序历史记录并找到 livy-session-xx 用于将 xx 编号为 1、2、...
标签: pyspark amazon-emr