【问题标题】:group by with resample has column is being duplicatedgroup by with resample has 列被复制
【发布时间】:2021-11-26 20:05:03
【问题描述】:

背景:我有汇总到州级的 covid 数据。然后我将我的日子汇总到周级别(这有效)。但是,当我在县级使用几乎完全相同的数据运行每日逻辑时,我得到了一个错误。更具体地说,我在索引和数据中得到了相同的列。

左边是汇总的州数据,右边是汇总的县数据...

这是正在工作的状态数据代码...

df_covid_data = df_covid_data.groupby("State").resample('W-SAT', label='right', closed = 'right', on='date').sum().sort_values(by=['State','date'])

这是不起作用的县代码(基本相同)(请注意,如果我取消注释结尾我会收到错误,因为countyFIPS 包含两次)。我尝试删除 nan 列,但这没有帮助...

df_covid_data_c = df_covid_data_c.groupby("countyFIPS").resample('W-SAT', label='right', closed = 'right', on='date').sum()#.sort_values(by=['countyFIPS','date'])

这是输出...

PS 引入原始数据...

COVID_FILE =   
    'covid_confirmed_usafacts' #https://usafacts.org/visualizations/coronavirus-covid-19-spread-map grab confirmed cases

df_cum_covid_data=pd.read_csv(DATA_PATH+COVID_FILE+'.csv', sep=',').dropna(axis=1, how='all').dropna(axis=0, how='all')#read in covid data

【问题讨论】:

标签: python pandas group-by pandas-resample


【解决方案1】:

我发现问题是县 id (countyFISP) 是以浮点数形式出现的,这会按功能混淆分组。如果我在途中将其转换为整数,那么代码就会运行。

【讨论】:

    猜你喜欢
    • 2011-03-30
    • 2014-05-15
    • 2020-08-02
    • 2017-03-22
    • 2021-03-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多