【发布时间】:2019-05-20 03:25:34
【问题描述】:
安装 anaconda3 并安装 spark(2.3.2) 后,我正在尝试运行示例 pyspark 代码。
这只是我通过 Jupyter 运行的示例程序, 我收到一个类似
的错误Python worker 无法重新连接。
根据堆栈溢出中的以下问题:
Python worker failed to connect back
我可以看到这样的解决方案 我得到了同样的错误。我安装了以前版本的 Spark(2.3 而不是 2.4)解决了它。现在完美运行了,可能是最新版pyspark的问题。
但我使用的是 spark 2.3.1 版本,python 版本是 3.7
仍然,我面临着这个问题。请帮我解决这个错误
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("mySparkApp").getOrCreate()
testData=spark.sparkContext.parallelize([3,8,2,5])
testData.count()
回溯是:
Py4JJavaError: An error occurred while calling z:org.apache.spark.api.python.PythonRDD.collectAndServe.
: org.apache.spark.SparkException: Job aborted due to stage failure: Task 2 in stage 1.0 failed 1 times, most recent failure: Lost task 2.0 in stage 1.0 (TID 6, localhost, executor driver): org.apache.spark.SparkException: Python worker failed to connect back.
at org.apache.spark.api.python.PythonWorkerFactory.createSimpleWorker(PythonWorkerFactory.scala:170)
at org.apache.spark.api.python.PythonWorkerFactory.create(PythonWorkerFactory.scala:97)
at org.apache.spark.SparkEnv.createPythonWorker(SparkEnv.scala:117)
at org.apache.spark.api.python.BasePythonRunner.compute(PythonRunner.scala:108)
at org.apache.spark.api.python.PythonRDD.compute(PythonRDD.scala:65)
at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:324)
【问题讨论】:
-
我无法在我的 Windows 10 机器上复制此问题。
-
对不起,我没有得到...你的意思
-
我在我的 Windows 10 机器上执行了您提供的代码,并且正在运行 Apache Spark 2.3.0。我无法复制此错误。
标签: apache-spark pyspark