【问题标题】:Function in pandas dataframe that replicates dplyr group_by(multiple variables) function in R复制 R 中的 dplyr group_by(multiple variables) 函数的 pandas 数据框中的函数
【发布时间】:2017-06-19 09:30:26
【问题描述】:

考虑这种情况:

Python pandas equvilant to R groupby mutate

dplyr

df = df%>% group_by(a,b) %>%  

表示首先数据框按列 a 分组,然后按 b 分组。

在我的情况下,我首先尝试按 group_name 列对数据进行分组,然后按 user_name 分组,然后按 type_of_work 分组。列不止三列(这就是我感到困惑的原因),但我需要根据这三个标题以相同的顺序对数据进行分组。在这个阶段之后,我已经有了一个算法来处理列。我只需要一个算法来创建根据这三列分组的数据框。

在我的例子中,像dplyr 函数一样保留序列很重要。

pandas 数据框中有类似的东西吗?

【问题讨论】:

  • 你读过docs吗?
  • 试试 df.groupby?
  • @EdChum 我在使用 groupby 和 apply 方法时卡住了,因为显然 groupby 不能轻易分配给数据框。

标签: python r pandas dataframe


【解决方案1】:

分组 = df.groupby(['a', 'b'])

阅读 pandas 文档中有关“split-apply-combine”策略的更多信息,了解 pandas 与 R 相比如何处理这些问题。

从您的评论看来,您想要分配分组的框架。您可以通过 API 使用 groupbyobject,例如 grouped.mean(),也可以遍历 groupby 对象。您将在每个循环中获得名称和组。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2015-11-18
    • 1970-01-01
    • 1970-01-01
    • 2014-06-04
    • 2018-05-12
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多