【发布时间】:2017-07-27 15:01:25
【问题描述】:
好的,我似乎找不到解决方案,所以这是我的问题。如果来自 stackoverflow 社区的人能尽快提出解决方案,我将不胜感激,因为我必须提交结果。
我有两个 csv 文件(可以作为数据帧加载)。一个 csv 文件有 1458644 行和 12 列,所有行条目都指定事件,持续时间为 6 个月的多天数秒。
另一个带有天气数据的csv文件有4432个条目,每天的天气数据用6个月的小时(这里没有秒持续时间)指定
我想要做的是结合两个文件的条目,使用一些pythonic操作(或与条件连接),以便将第二个数据帧的小时条目中的数据添加到第一个数据帧,但单个小时(在第二个数据帧中指定)在第一个数据帧的单个小时内被复制和重复
例如
第一个数据帧
Date: col1, cl2,
1/2/2013 12:05:00 yyy etc.
1/2/2013 12:12:00 yyy
1/2/2013 13:13:00 yyy
1/2/2013 14:14:00 yyy
1/2/2013 14:30:00 yyy
1/2/2013 14:45:00 yyy
1/2/2013 17:00:00 yyy
1/2/2013 17:17:00 yyy
1/2/2013 17:30:00 yyy
1/2/2013 18:17:00 yyy
1/2/2013 18:30:00 yyy
第二个数据帧
Date col3 col4
1/2/2013 12:00:00 xxx overcast
1/2/2013 13:00:00 xxx overcast
1/2/2013 14:00:00 xxx sunny
1/2/2013 15:00:00 xxx sunny
1/2/2013 16:00:00 xxx rain
1/2/2013 17:00:00 xxx rain
1/2/2013 18:00:00 xxx cloudy
最终结果应如下所示:
Date: col1, col2, col3, col4
1/2/2013 12:05:00 yyy etc. xxx overcast
1/2/2013 12:12:00 yyy xxx overcast
1/2/2013 13:13:00 yyy xxx overcast
1/2/2013 14:14:00 yyy xxx sunny
1/2/2013 14:30:00 yyy xxx sunny
1/2/2013 14:45:00 yyy xxx sunny
1/2/2013 17:00:00 yyy xxx rain
1/2/2013 17:17:00 yyy xxx rain
1/2/2013 17:30:00 yyy xxx rain
1/2/2013 18:17:00 yyy xxx cloudy
1/2/2013 18:30:00 yyy xxx cloudy
【问题讨论】:
-
因此,对于 frame1 中的每个记录/行,您在 frame2 中查找相同的小时,以及它的列?并且在 1 和 2 之间有可变数量的匹配。
标签: python pandas dataframe duplicates concatenation