【问题标题】:Parallelize pandas function pd.concat并行化 pandas 函数 pd.concat
【发布时间】:2020-04-18 11:30:11
【问题描述】:

我有一个名为 df_list 的大量数据框列表(包含一些不同的列和一些常见的列),我希望将其合并到一个大数据框中。我尝试了以下方法:

all_dfs = pd.concat(df_list)

虽然这在单个内核上花费了太多时间。我在 48 小时后杀死了脚本。您将如何并行化此过程以使用我所有的内核或重写代码以使其更快

【问题讨论】:

    标签: python pandas multithreading parallel-processing


    【解决方案1】:

    pandas - 与parallel processing 无关。

    最简单的方法是使用第三方工具来处理巨大的数据帧。您可以在不同的节点上运行数据集的计算/处理。

    • 可以看dask(类似pandas接口)。

    • 你可以看看pyspark

    您还可以使用swifter 在多个内核上运行处理。

    可能还有其他一些工具...换句话说,在您的情况下,最好在cluster 中运行计算。

    希望这会有所帮助。

    【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-03-14
    • 2021-05-03
    • 2017-01-10
    • 1970-01-01
    • 2022-01-01
    • 2014-04-27
    相关资源
    最近更新 更多