【发布时间】:2020-07-09 23:28:49
【问题描述】:
当我尝试在 pyspark 执行此命令行时
arquivo = sc.textFile("dataset_analise_sentimento.csv")
我收到以下错误消息:
Py4JJavaError: An error occurred while calling z:
org.apache.spark.api.python.PythonRDD.runJob.:
org.apache.spark.SparkException: Job aborted due to stage failure:
Task 0 in stage 0.0 failed 1 times, most recent failure:
Lost task 0.0 in stage 0.0 (TID 0, localhost, executor driver):
org.apache.spark.SparkException: Python worker failed to connect back.
我尝试了以下步骤:
- 检查环境变量。
- 检查在 Windows 10 上安装 Apache Spark 的步骤。
- 使用不同版本的 Apache Spark(已尝试 2.4.3 / 2.4.2 / 2.3.4)。
- 禁用我已安装的防火墙窗口和防病毒软件。
- 尝试使用
sc = spark.sparkContext手动初始化 SparkContext(在 Stackoverflow 的 this question 处找到了这个可能的解决方案,但对我不起作用)。 - 尝试将
PYSPARK_DRIVER_PYTHON的值从jupyter改成ipython,如这个link所说,没有成功。
以上步骤均不适合我,我找不到解决方案。
其实我用的是以下版本:
Python 3.7.3、Java JDK 11.0.6、Windows 10、Apache Spark 2.3.4
【问题讨论】:
标签: python apache-spark pyspark