【问题标题】:How to get the filtered dataframe for calculations while retaining the original one in pandas?如何获取过滤后的数据框进行计算,同时在熊猫中保留原始数据框?
【发布时间】:2014-01-13 04:31:16
【问题描述】:

我对 pandas 如何使用过滤行有些困惑。 假设我们有这个市场数据数据框'df':

Time                    Open    High    Low     Close   Volume
31.12.2003 23:00:00.000 82440   83150   82440   82880   47686.32
01.01.2004 23:00:00.000 82830   83100   82350   83100   37571.04
02.01.2004 23:00:00.000 83100   83100   83100   83100   0.00

现在我们过滤行以仅获取市场开放日的 df (Volume>0)

df=df[df['Volume']>0]

由于我们过滤数据框的方式,有一些空行仍然有索引和值,但它们不用于计算,例如,如果我们这样做:

df.mean()

过滤后的行的值不会出现在计算中。

令人困惑的部分来了:

我们如何仅使用未过滤的值来计算从第 3 行开始计数的最后 2 个值的平均值? 意思是,如果我们过滤掉第 2 行,它应该得到第 3 行和第 1 行的平均值。

----------- 编辑 -------------- 嘿,感谢您的评论,试图更清楚:

假设我们有这个示例数据框:

Index    Volume
0        1 
1        0
2        1
3        1

然后我们过滤它:

df=df[df['Volume']>0]

如果我们将数据帧发送到 numpy,以便在数据帧中进行绘图或工作迭代,它还会发送我们不想要的行。

如果我们迭代该数据,它也会迭代(并考虑)我们排除的索引。

那么,我们如何获取排除排除行的数据帧副本,以避免这两个问题?

【问题讨论】:

  • 你能提供更多关于你期望得到什么的细节吗?你的措辞太模棱两可了。
  • 我正在研究 ipython 以获得我的意思的工作示例,一旦我找到它就会发布。我意识到这还不清楚
  • 为什么你认为它会通过排除的行?前任在您的最后一个示例中,df[df['Volume']>0].values 将是一个形状为 (3, 1) 的数组。
  • 因为我使用这样的数据框进行绘图,我得到了这个:i.imgur.com/IMzT6TS.png 所以即使它们被排除在数据框中,它也会从数据框中得到排除的索引。 (烛台之间的空间被排除在外,但它们仍然以这种方式显示)
  • 这不是行而是索引。您可能只想简单地执行df = df.reset_index(drop=True) 来重新索引您的数据框。

标签: python filter pandas


【解决方案1】:

我认为您在布尔索引方面遇到了一个很常见的问题。当您尝试使用布尔值的DataFrame 过滤DataFrame 时,您需要指定如何处理某些列/行为真,而其他列/行为假的情况。您是否想要任何地方任何地方都为真的物品。

在这种情况下特别棘手,因为您的 DataFrame 是一维的,所以您希望事情像 Series 一样工作,其中没有歧义:Series 一行是 True 或 False ;它不能在某些列中为 True,而在其他列中为 False。

要使用DataFrames 解决歧义,请使用any()all() 方法:

In [36]: df
Out[36]: 
       Volume
Index        
0           1
1           0
2           1
3           1

[4 rows x 1 columns]

In [37]: df[(df > 0).all(1)]
Out[37]: 
       Volume
Index        
0           1
2           1
3           1

[3 rows x 1 columns]

all() 内的1 只是跨过1 轴(列)


这是一个二维示例,可能有助于理清思路:

In [39]: df = pd.DataFrame({"A": ['a', 'b', 'c', 'd'], "B": ['e', 'f', 'g', 'h']})

In [40]: df
Out[40]: 
   A  B
0  a  e
1  b  f
2  c  g
3  d  h

[4 rows x 2 columns]

In [41]: bf = pd.DataFrame({"A": [True, True, False, False], "B": [True, False, True, False]})

In [42]: bf
Out[42]: 
       A      B
0   True   True
1   True  False
2  False   True
3  False  False

[4 rows x 2 columns]

首先,“错误”的方式,未解决的歧义。目前还不清楚如何处理 (1, 'B'),因为它在 bf 中是错误的,但是有一个 1 行和一个 B 列,所以填充了一个 NaN

In [43]: df[bf]
Out[43]: 
     A    B
0    a    e
1    b  NaN
2  NaN    g
3  NaN  NaN

[4 rows x 2 columns]

All 只匹配第一行,因为这是唯一一个同时具有 True 的:

In [44]: df[bf.all(1)]
Out[44]: 
   A  B
0  a  e

[1 rows x 2 columns]

any 匹配除最后一行之外的所有行,因为该行同时具有Falsees

In [45]: df[bf.any(1)]
Out[45]: 
   A  B
0  a  e
1  b  f
2  c  g

[3 rows x 2 columns]

【讨论】:

  • 哇,我自己要花很多时间才能弄清楚!感谢这宝贵的一课!
猜你喜欢
  • 1970-01-01
  • 2021-03-12
  • 1970-01-01
  • 2017-05-18
  • 2014-01-09
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多