【发布时间】:2019-12-03 22:49:21
【问题描述】:
我有一个 Python 函数(如下所示),它从 S3 读取多个 csv 文件并将它们分别保存为字典中的 Pandas DataFrames。有没有办法并行化这个过程,以便可以同时读取tables 中的多个项目而不是一个接一个?
# Load libraries
import pandas as pd
import dask.dataframe as dd
# Define function
def read_data(bucket_name, tables):
all_data = dict()
for t in tables:
all_data[t] = dd.read_csv('s3://{}/{}/*.csv'.format(bucket_name, t)).compute()
return all_data
# Define arguments
bucket_name = 's3://my-bucket'
tables = ['sales', 'customers', 'inventory']
# Run function
all_data = read_data(bucket_name, tables)
【问题讨论】:
标签: python pandas parallel-processing multiprocessing dask