【问题标题】:Pandas Merge (pd.merge) How to set the index and joinPandas Merge (pd.merge) 如何设置索引并加入
【发布时间】:2012-12-29 19:00:13
【问题描述】:

我有两个 pandas 数据框:dfLeft 和 dfRight,以日期为索引。

df左:

            cusip    factorL
date  
2012-01-03    XXXX      4.5
2012-01-03    YYYY      6.2
....
2012-01-04    XXXX      4.7
2012-01-04    YYYY      6.1
....

df右:

            idc__id    factorR
date  
2012-01-03    XXXX      5.0
2012-01-03    YYYY      6.0
....
2012-01-04    XXXX      5.1
2012-01-04    YYYY      6.2

两者的形状都接近(121900,3)

我尝试了以下合并:

test = pd.merge(dfLeft, dfRight, left_index=True, right_index=True, left_on='cusip', right_on='idc__id', how = 'inner')

这给了测试(60643500, 6)的形状。

关于这里出了什么问题有什么建议吗?我希望它基于日期和 cusip/idc_id 合并。注意:在本例中,尖点是一字排开的,但实际上可能并非如此。

谢谢。

预期输出 测试:

             cusip    factorL    factorR
date  
2012-01-03    XXXX      4.5          5.0
2012-01-03    YYYY      6.2          6.0
....
2012-01-04    XXXX      4.7          5.1
2012-01-04    YYYY      6.1          6.2

【问题讨论】:

    标签: python pandas


    【解决方案1】:

    您可以在join 之前将'cuspin''idc_id' 作为索引附加到您的DataFrames(这是它在前几行上的工作方式):

    In [10]: dfL
    Out[10]: 
               cuspin  factorL
    date                      
    2012-01-03   XXXX      4.5
    2012-01-03   YYYY      6.2
    
    In [11]: dfL1 = dfLeft.set_index('cuspin', append=True)
    
    In [12]: dfR1 = dfRight.set_index('idc_id', append=True)
    
    In [13]: dfL1
    Out[13]: 
                       factorL
    date       cuspin         
    2012-01-03 XXXX        4.5
               YYYY        6.2
    
    In [14]: dfL1.join(dfR1)
    Out[14]: 
                       factorL  factorR
    date       cuspin                  
    2012-01-03 XXXX        4.5        5
               YYYY        6.2        6
    

    【讨论】:

      【解决方案2】:

      重置索引,然后在多个(列)键上合并:

      dfLeft.reset_index(inplace=True)
      dfRight.reset_index(inplace=True)
      dfMerged = pd.merge(dfLeft, dfRight,
                    left_on=['date', 'cusip'],
                    right_on=['date', 'idc__id'],
                    how='inner')
      

      然后您可以将“日期”重置为索引:

      dfMerged.set_index('date', inplace=True)
      

      这是一个例子:

      raw1 = '''
      2012-01-03    XXXX      4.5
      2012-01-03    YYYY      6.2
      2012-01-04    XXXX      4.7
      2012-01-04    YYYY      6.1
      '''
      
      raw2 = '''
      2012-01-03    XYXX      45.
      2012-01-03    YYYY      62.
      2012-01-04    XXXX      -47.
      2012-01-05    YYYY      61.
      '''
      
      import pandas as pd
      from StringIO import StringIO
      
      
      df1 = pd.read_table(StringIO(raw1), header=None,
                          delim_whitespace=True, parse_dates=[0], skiprows=1)
      df2 = pd.read_table(StringIO(raw2), header=None,
                          delim_whitespace=True, parse_dates=[0], skiprows=1)
      
      df1.columns = ['date', 'cusip', 'factorL']
      df2.columns = ['date', 'idc__id', 'factorL']
      
      print pd.merge(df1, df2,
               left_on=['date', 'cusip'],
               right_on=['date', 'idc__id'],
               how='inner')
      

      给了

                        date cusip  factorL_x idc__id  factorL_y
      0  2012-01-03 00:00:00  YYYY        6.2    YYYY         62
      1  2012-01-04 00:00:00  XXXX        4.7    XXXX        -47
      

      【讨论】:

      • 这也很好,因为您不必创建数据帧的副本。
      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-09-05
      • 2021-11-25
      • 2019-05-04
      • 2017-11-27
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多