【发布时间】:2016-07-10 19:29:51
【问题描述】:
有一个缺少值的 pyspark 数据框:
tbl = sc.parallelize([
Row(first_name='Alice', last_name='Cooper'),
Row(first_name='Prince', last_name=None),
Row(first_name=None, last_name='Lenon')
]).toDF()
tbl.show()
这是桌子:
+----------+---------+
|first_name|last_name|
+----------+---------+
| Alice| Cooper|
| Prince| null|
| null| Lenon|
+----------+---------+
我想新建一个列如下:
- 如果名字为无,则取姓氏
- 如果姓氏为无,取名
- 如果它们都存在,则将它们连接起来
- 我们可以放心地假设其中至少存在一个
我可以构造一个简单的函数:
def combine_data(row):
if row.last_name is None:
return row.first_name
elif row.first_name is None:
return row.last_name
else:
return '%s %s' % (row.first_name, row.last_name)
tbl.map(combine_data).collect()
我确实得到了正确的结果,但我无法将其作为列附加到表中:tbl.withColumn('new_col', tbl.map(combine_data)) 导致 AssertionError: col should be Column
将map 的结果转换为Column 的最佳方法是什么?是否有处理null 值的首选方法?
【问题讨论】:
-
我的回答还不够吗?有什么限制吗?
标签: python apache-spark dataframe pyspark apache-spark-sql