【发布时间】:2018-08-06 13:14:11
【问题描述】:
我需要将多个 csv 文件合并到一个对象中(我假设是一个数据框),但它们都有不匹配的列,如下所示:
CSV A
store_location_key | product_key | collector_key | trans_dt | sales | units | trans_key
CSV B
collector_key | trans_dt | store_location_key | product_key | sales | units | trans_key
CSV C
collector_key | trans_dt | store_location_key |product_key | sales | units | trans_id
除此之外,我还需要将这些与另外两个具有匹配列的 csv 文件相匹配:
位置 CSV
store_location_key | region | province | city | postal_code | banner | store_num
产品 CSV
product_key | sku | item_name | item_description | department | category
数据类型都是一致的,即sales列始终是float,store_location_key始终是int等。即使我先将每个csv转换为数据框,我也不确定join是否可以工作(除了最后两个)因为列需要匹配的方式。
【问题讨论】:
-
trans_key和trans_id应该是相同的还是不同的列? -
感谢您的回复...我不确定,但我认为最好将它们视为不同的列。
-
一两个文件的示例输入会很有帮助,也请分享您迄今为止尝试过的内容。
标签: csv apache-spark pyspark spark-dataframe data-analysis