【发布时间】:2020-02-28 13:48:22
【问题描述】:
当我使用 dask 使用 map_partitions 进行 groupby 时,与简单的 pandas groupby 相比,我获得了重复的数据和错误的结果。但是当我使用 n_partitons=1 时,我得到了正确的结果。 为什么会这样?以及如何使用多个分区并仍然获得正确的结果?
我的代码是
measurements = measurements.repartition(n_partitions=38)
measurements.map_partitions(lambda df : df.groupby(["id",df.time.dt.to_period("M"),
"country","job"]).source.nunique()).compute().reset_index()
在熊猫中,我愿意
measurements.groupby(["id",measurements.time.dt.to_period("M"),
"country","job"]).source.nunique().reset_index()
PS:我在单机上使用本地集群。
【问题讨论】:
标签: python pandas parallel-processing distributed-computing dask