【发布时间】:2017-12-14 00:37:29
【问题描述】:
datasets = {}
datasets['df1'] = df1
datasets['df2'] = df2
datasets['df3'] = df3
datasets['df4'] = df4
def prepare_dataframe(dataframe):
return dataframe.apply(lambda x: x.astype(str).str.lower().str.replace('[^\w\s]', ''))
for key, value in datasets.items():
datasets[key] = prepare_dataframe(value)
我需要准备一些数据框中的数据以供进一步分析。我想并行化使用准备好的数据框更新字典的 for 循环。该代码最终将在具有数十个内核和数千个数据帧的机器上运行。在我的本地机器上,prepare_dataframe 函数中似乎没有使用多个内核。
我查看了 Numba 和 Joblib,但在这两个库中都找不到使用字典值的方法。
非常感谢任何见解!
【问题讨论】:
标签: python multithreading pandas dictionary parallel-processing