【问题标题】:How to convert pandas dataframe to pyspark dataframe which has attribute to rdd?如何将 pandas 数据框转换为具有 rdd 属性的 pyspark 数据框?
【发布时间】:2018-09-08 08:44:40
【问题描述】:

现在我正在为我的课程做一个项目,并发现将 pandas dataframe 转换为 pyspark dataframe 的问题。 我已经生成了一个名为 data_org 的熊猫数据框,如下所示。 enter image description here

我想将其转换为 pyspark 数据帧以将其调整为 libsvm 格式。 所以我的代码是

from pyspark.sql import SQLContext  
spark_df = SQLContext.createDataFrame(data_org)

但是,它出错了。

TypeError: createDataFrame() 缺少 1 个必需的位置参数:'data'

我真的不知道该怎么办。我的python版本是3.5.2,pyspark版本是2.0.1。 我期待着您的回复。

【问题讨论】:

    标签: python pandas dataframe pyspark


    【解决方案1】:

    首先将 sparkContext 传递给 SQLContext:

    from pyspark import SparkContext
    from pyspark.sql import SQLContext 
    sc = SparkContext("local", "App Name")
    sql = SQLContext(sc)
    

    然后使用createDataFrame,如下所示:

    spark_df = sql.createDataFrame(data_org)
    

    【讨论】:

    • sc是什么意思?我首先通过 pandas 数据框的格式获取我的数据。
    • sc 表示 sparkContext。如果你使用 spark-submit 运行脚本,它会被 spark 初始化
    • 我使用 anaconda spyder 运行到 pyspark 代码。这种情况如何解决?
    • 谢谢一百万!
    • 你能帮我解决我的另一个问题吗?stackoverflow.com/questions/49559331/…
    猜你喜欢
    • 1970-01-01
    • 2022-08-16
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-08-25
    • 1970-01-01
    相关资源
    最近更新 更多