【发布时间】:2019-07-17 02:31:30
【问题描述】:
如何将 csv 文件 without any schema 加载到 spark rdd 和
数据框并分配架构
我有一个包含这样数据的文件
AA,19970101,47.82,47.82,47.82,47.82,0
架构应该是
stockname,date,highprice,lowprice,openprice,closeprice,volume
【问题讨论】:
标签: pyspark
如何将 csv 文件 without any schema 加载到 spark rdd 和
数据框并分配架构
AA,19970101,47.82,47.82,47.82,47.82,0
stockname,date,highprice,lowprice,openprice,closeprice,volume
【问题讨论】:
标签: pyspark
也许您可以先为输入数据创建 rdd,然后在 rdd 之上创建带有模式的数据框。
from pyspark.sql.types import StructType
from pyspark.sql.types import StructField
from pyspark.sql.types import *
rdd = sc.textFile("//path/to/textfile/file.txt")
schema = StructType([
StructField("id", IntegerType(), True),
StructField("created_at", TimestampType(), True),
StructField("updated_at", StringType(), True)
])
df = sqlContext.createDataFrame(rdd, schema)
【讨论】: