【发布时间】:2020-01-17 11:06:19
【问题描述】:
我正在尝试根据某些数据手动创建一个 pyspark 数据框:
row_in=[(1566429545575348),(40.353977),(-111.701859)]
rdd=sc.parallelize(row_in)
schema = StructType([StructField("time_epocs", DecimalType(), True),StructField("lat", DecimalType(),True),StructField("long", DecimalType(),True)])
df_in_test=spark.createDataFrame(rdd,schema)
当我尝试显示数据框时出现错误,所以我不知道该怎么做。
但是,Spark 文档对我来说似乎有点令人费解here,当我尝试按照这些说明进行操作时,我遇到了类似的错误。
有人知道怎么做吗?
【问题讨论】:
-
如果
row_in=[(1566429545575348, 40.353977,-111.701859)],您的代码应该可以工作 -
即使使用 row_in=[(1566429545575348, 40.353977,-111.701859)] 也不起作用
-
真正的问题在于
(1)是一个int,而不是一个元组。当你只有1个元素时,你需要添加一个逗号来创建元组(1,)
标签: pyspark pyspark-dataframes