【发布时间】:2020-10-22 07:38:50
【问题描述】:
在拆分数据数据类型更改后,我已将数据从文本文件加载到 Spark RDD。如何在不更改数据类型的情况下进行拆分,或者如何将拆分后的数据转换为原始数据类型?
我的代码
from pyspark import SparkConf, SparkContext
conf = SparkConf().setMaster("local").setAppName("Movie")
sc = SparkContext(conf = conf)
movies = sc.textFile("file:///SaprkCourse/movie/movies.txt")
data=movies.map(lambda x: x.split(","))
data.collect()
我的意见是这样的
userId,movieId,rating,timestamp
1,1,4.0,964982703
1,3,4.0,964981247
1,6,4.0,964982224
1,47,5.0,964983815
1,50,5.0,964982931
拆分后我的完整数据改为String类型
我要求输出与输入文本文件中的数据类型相同,如IntegerType, IntegerType, IntegerType, IntegerType
【问题讨论】:
标签: apache-spark hadoop pyspark