【问题标题】:Not Able to Run Pyspark in Google Colab无法在 Google Colab 中运行 Pyspark
【发布时间】:2020-06-04 15:52:13
【问题描述】:

您好,我正在尝试使用以下代码在 google colab 上运行 pyspark:

!apt-get install openjdk-8-jdk-headless -qq > /dev/null
!wget -q http://apache.osuosl.org/spark/spark-2.4.5/spark-2.4.5-bin-hadoop2.7.tgz
!tar xf spark-2.4.5-bin-hadoop2.7.tgz
!pip install -q findspark
import os
os.environ["JAVA_HOME"] = "/usr/lib/jvm/java-8-openjdk-amd64"
os.environ["SPARK_HOME"] = "/content/spark-2.4.5-bin-hadoop2.7"
import findspark
findspark.init()
from pyspark.sql import SparkSession
spark = SparkSession.builder.master("local[*]").getOrCreate()

我收到以下错误:

/content/spark-2.4.5-bin-hadoop2.7/python/pyspark/java_gateway.py in _launch_gateway(conf, insecure)
    106 
    107             if not os.path.isfile(conn_info_file):
--> 108                 raise Exception("Java gateway process exited before sending its port number")
    109 
    110             with open(conn_info_file, "rb") as info:

Exception: Java gateway process exited before sending its port number

注意:我可以运行这段代码直到今天下午,突然这个错误开始出现在晚上

【问题讨论】:

    标签: python apache-spark pyspark jupyter-notebook google-colaboratory


    【解决方案1】:

    请检查 wget 是否正常工作。如果没有,请将最新版本的 apache-spark 上传到 google drive 并解压到 google collaboratory,然后添加给定的路径。您的代码无法正常工作,因为它无法找到 spark 文件夹。 wget 不工作

    【讨论】:

      【解决方案2】:

      以下是我始终开始的步骤: 1st删除不必要的ubuntu错误或Java端口错误

      !sudo add-apt-repository --remove ppa:vikoadi/ppa
      !sudo apt update
      

      重新开始的第二个代码

      !pip install pyspark
      

      来自网站的第三个代码新鲜的java和最新的spark表(如果显示错误,你可以更改链接并获取任何你喜欢的)

      !apt-get install openjdk-8-jdk-headless -qq > /dev/null
      !wget -q https://www-us.apache.org/dist/spark/spark-3.1.1/spark-3.1.1-bin-hadoop3.2.tgz
      !tar xf spark-3.1.1-bin-hadoop3.2.tgz
      !pip install -q findspark
      

      第 4 个代码创建会话或在此处配置您需要的大小或内存,例如 4G

      from pyspark.sql import SparkSession
      spark = SparkSession.builder.master("local[*]").getOrCreate()
      spark=SparkSession.builder.appName('sol').getOrCreate()
      spark.conf.set("spark.driver.memory","4g")
      

      第 5 个代码检查我的任何数据的会话

      from google.colab import files
      files.upload() #to upload the testing file for example mydata.csv 
      dataset = spark.read.csv('mydata.csv',inferSchema=True, header =True)
      dataset.printSchema()
      

      那我希望一切都好。没用的请留言

      【讨论】:

        【解决方案3】:

        Google 协作已预先安装了 java。所以如果你只是运行

        !pip install pyspark
        

        然后使用 spark 就可以了。不需要 findspark 或其他不必要的库。

        【讨论】:

        • 在阅读文件之前,能否请您多说一些关于开始会话的信息?
        【解决方案4】:

        只需以下命令

        单元格1

        !pip install pyspark
        

        单元格 2

        spark = SparkSession.builder\
            .master("local")\
            .appName("Colab")\
            .getOrCreate()
        
        df = spark.read.option("header",True).format("csv").load(url)
        df.show()
        

        【讨论】:

          猜你喜欢
          • 2019-08-28
          • 1970-01-01
          • 2019-04-14
          • 2023-02-25
          • 2020-11-29
          • 1970-01-01
          • 2020-10-17
          • 2022-12-14
          • 2020-12-01
          相关资源
          最近更新 更多