【问题标题】:SparkException: Python worker failed to connect back when execute spark actionSparkException:Python 工作者在执行火花动作时无法连接回来
【发布时间】:2020-07-09 23:28:49
【问题描述】:

当我尝试在 pyspark 执行此命令行时

arquivo = sc.textFile("dataset_analise_sentimento.csv")

我收到以下错误消息:

Py4JJavaError: An error occurred while calling z:
org.apache.spark.api.python.PythonRDD.runJob.: 
org.apache.spark.SparkException: Job aborted due to stage failure: 
Task 0 in stage 0.0 failed 1 times, most recent failure:
Lost task 0.0 in stage 0.0 (TID 0, localhost, executor driver):
org.apache.spark.SparkException: Python worker failed to connect back.

我尝试了以下步骤:

  • 检查环境变量。
  • 检查在 Windows 10 上安装 Apache Spark 的步骤。
  • 使用不同版本的 Apache Spark(已尝试 2.4.3 / 2.4.2 / 2.3.4)。
  • 禁用我已安装的防火墙窗口和防病毒软件。
  • 尝试使用 sc = spark.sparkContext 手动初始化 SparkContext(在 Stackoverflow 的 this question 处找到了这个可能的解决方案,但对我不起作用)。
  • 尝试将PYSPARK_DRIVER_PYTHON的值从jupyter改成ipython,如这个link所说,没有成功。

以上步骤均不适合我,我找不到解决方案。

其实我用的是以下版本:

Python 3.7.3、Java JDK 11.0.6、Windows 10、Apache Spark 2.3.4

【问题讨论】:

    标签: python apache-spark pyspark


    【解决方案1】:

    我只是配置了以下变量环境,现在可以正常工作了:

    • HADOOP_HOME = C:\Hadoop
    • JAVA_HOME = C:\Java\jdk-11.0.6
    • PYSPARK_DRIVER_PYTHON = jupyter
    • PYSPARK_DRIVER_PYTHON_OPTS = notebook
    • PYSPARK_PYTHON = python

    实际上我使用的是以下版本:

    Python 3.7.3、Java JDK 11.0.6、Windows 10、Apache Spark 2.4.3 并使用带有 pyspark 的 Jupyter Notebook。

    【讨论】:

      【解决方案2】:

      我遇到了同样的错误。通过 JDK 11 的 Java 类路径解决了它。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2021-06-28
        • 2017-08-27
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多