【发布时间】:2020-06-15 15:27:37
【问题描述】:
假设有一个包含多列的数据框,看起来像这样(我省略了不必要的列):
+----------------------------------------+
|path |
+----------------------------------------+
|/tmp/some_folder/2020-04-02/blabla1.parq|
|/tmp/some_folder/2020-05-14/bla2bla.parq|
+----------------------------------------+
其中 path 是 hdfs 中的某个 parquet 文件,它只有一行,结构如下:
+-----------+
|value |
+-----------+
|some value |
+-----------+
如何读取这些文件并向初始数据框添加一列(“值”)?结果,我想要这样的结构:
+----------------------------------------+----------+
|path |value |
+----------------------------------------+----------+
|/tmp/some_folder/2020-04-02/blabla1.parq|some value|
|/tmp/some_folder/2020-05-14/bla2bla.parq|bla blah |
+----------------------------------------+----------+
例如,我可以将“路径”列转换为列表,通过迭代将其读入数据帧并与初始数据帧连接。还有其他解决方案吗?最好在性能方面更快。
【问题讨论】:
标签: python apache-spark pyspark apache-spark-sql