【问题标题】:Filtering a pandas series using a lambda expression that operates on individual elements使用对单个元素进行操作的 lambda 表达式过滤 pandas 系列
【发布时间】:2017-12-31 21:24:25
【问题描述】:

我正在尝试使用 pandas 将 map 和 filter 操作链接在一起。 我遇到了几个选项,部分概述在这里: Pandas How to filter a Series

总结一下,

s = Series(range(10))

s.where(s > 4).dropna()
s.where(lambda x: x > 4).dropna()

s.loc[s > 4]
s.loc[lambda x: x > 4]

s.to_frame(name='x').query("x > 4")

这对于数值比较和相等性检查很好,但它不适用于涉及其他操作的谓词。 举个简单的例子,考虑匹配字符串的第一个字符。

s = Series(['aa', 'ab', 'ba'])
s.loc[lambda x: x.startswith('a')] # fails

此操作失败并显示类似“系列没有属性 'startswith'”的消息,因为传递给第二行中 lambda 表达式的参数 x 是系列本身,而不是它包含的单个元素。

有趣的是 map 确实允许按元素访问:

Series(list('abcd')).map(lambda x: x.upper())
# results in ['A', 'B', 'C', 'D'] even though Series has no upper method

虽然可能有一些巧妙的方法来处理startswith 示例,但我希望找到一个更通用的解决方案,其中可以使用接受集合中单个值的函数来过滤系列。理想情况下,它将允许将操作链接在一起,如下所示,

s = (Series(...)
        .map(...)
        .where(...)
        .map(...))

pandas 支持吗?

更新: Scott 为值是字符串的情况提供了答案,可以使用Series.str 处理,如他的回答中所述。

但是对于 Series 包含对象的情况呢? 有什么方法可以访问它们的属性或对它们应用函数吗?

我想管理这种情况的标准方法是将对象的相关字段解构到数据框中,其中每个属性都是一列。尽管在某些情况下,有人可能希望使用 map 和 filter(loc/where) 转换对象集合,而不必将复杂类型分解为数据框,然后立即转换回来。

我部分尝试在 python 中找到标准 map()/filter() 函数的替代方法,其中操作必须反向嵌套。

即,

map(function3, filter(function2, map(function1, collection)))

【问题讨论】:

    标签: python python-3.x pandas dataframe series


    【解决方案1】:

    使用.str Pandas 系列和字符串操作所需的字符串访问器。

    s = Series(['aa', 'ab', 'ba'])
    s.loc[lambda x: x.str.startswith('a')]
    

    当您使用地图时,您将字符串函数应用于每个元素,因此您不需要字符串访问器。

    对于 @piRSquared 在 cmets 中的观点,您根本不需要 lambda,您可以使用布尔索引。

    s = pd.Series(['aa', 'ab', 'ba']) 
    s.loc[s.str.startswith('a')]
    

    s.str.startswith 返回一个 True False 布尔系列,当放置在系列的后备箱中时,它只返回与 True 对齐的值。

    【讨论】:

    • 谢谢。这正是我要处理的字符串案例。虽然我想知道是否有类似的功能来处理一系列任意对象。 (我更新了我上面的问题来解释)
    • 是的,您可以将自定义函数映射并应用到您的系列中。
    • 有没有办法用(loc/where/query)过滤?每次我尝试它都会抛出一个错误。映射并申请工作
    【解决方案2】:
    s = Series(['aa', 'ab', 'ba'])
    s.loc[lambda x: x.startswith('a')] # fails
    

    这会失败,因为.loc[] 需要一个 True/False 值的系列/数组,而提供的 lambda 函数无法提供这些值。在一般情况下有效的简单解决方案是首先使用.map() 将条件应用于每个元素,然后将生成的布尔数组提供给.loc[]。像这样:

    s = Series(['aa', 'ab', 'ba'])
    s.loc[s.map(lambda x: x.startswith('a'))]
    

    【讨论】:

      猜你喜欢
      • 2016-09-24
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-06-07
      • 1970-01-01
      • 1970-01-01
      • 2018-09-19
      相关资源
      最近更新 更多