【发布时间】:2017-09-09 04:31:22
【问题描述】:
我有一个从 CSV 文件中派生的 DataFrame 结构,该文件涉及多年的人口统计数据。即,文件中的列是每月的时间间隔(1999-01、1999-02 ... 2016-12),行是世界上不同的人口中心(例如伦敦、多伦多、波士顿等):
df = pd.DataFrame({'1999-01' : [100, 5000, 8000], '1999-02' : [200, 6000, 9000], '1999-03' : [300, 7000, 10000], ..., cities : ['CityA', 'CityB', 'CityC' ...]})
我想按季度分隔这些列。因此,我将为每一行取 1999-01、1999-02、1999-9 的平均人口,并为此条目创建一个新列“1999Q1”,每 3 个月执行一次:
df_quarter = pd.DataFrame({'1999Q1' : [200, 6000, 9000], '1999Q2' : ..., cities = ['CityA', 'CityB', 'CityC' ...]})
#Q1 corresponds to months 01-03, Q2 to months 04-06, Q3 to months 07-09, Q4 months 10-12, all inclusive
但是,我很难将查询概念化以完成此操作。我有一半的想法先使用 .groupby(),然后使用 .agg(),但我不确定如何有效地指定 3 列分组并遍历列。有人可以指出我正确的方向吗?
编辑:假设列不是日期,而是更抽象的东西,并且不能使用简单的时间段重采样。例如:
#Prices of different foods from different vendors
df = pd.DataFrame({'oranges' : [2, 3, 7], 'apples' : [6, 3, 9], 'cheese' : [13, 9, 11], 'milk' : [6, 5, 12], 'vendors' : ['VendorA', 'VendorB', 'VendorC']})
现在,如果我想创建两列,结合水果和奶制品,有什么方法可以指定要聚合的索引吗?
【问题讨论】:
-
请阅读this 并学习如何提出一个好的熊猫问题。没有人会凭空为您提供示例和解决方案。
-
将进行适当的编辑。
标签: python pandas dataframe pandas-groupby