【发布时间】:2021-11-18 15:35:33
【问题描述】:
我遇到了一个问题,希望有人能提供帮助。
假设我有如下记录的传入数据流:
{ “标题”:[“col_a”,“col_b”,“col_c”,“col_d”],“数据”:[[“0”,“1”,“2”,“3”],[ "0.2","0.1","3","4"],["5","4","3","2"]]}
{ “标题”:[“col_a”,“col_b”,“col_c”,“col_d”],“数据”:[[“0.1”,“1.2”,“2.5”,“3”],[ "0","0","1","0"]]}
...
现在进一步假设数据被清理,使得:
- “headers”字段始终包含相同的数组
- “数据”数组中的数组始终与标头数组长度相同
在 PySpark 中是否可以将上述记录转换为如下所示的数据框?
| col_a | col_b | col_c | col_d |
|---|---|---|---|
| 0 | 1 | 2 | 3 |
| 0.2 | 0.1 | 3 | 4 |
| 5 | 4 | 3 | 2 |
| 0.1 | 1.2 | 2.5 | 3 |
| 0 | 0 | 1 | 0 |
非常感谢任何 cmets 和/或工作代码。
【问题讨论】:
标签: python arrays dataframe pyspark