【发布时间】:2018-07-05 02:06:38
【问题描述】:
当我在 mp 库启动的每个处理器中对分块 Pandas 数据帧使用多处理时,我遇到了一个未找到表的错误。
我正在通过以下方式将 pandasql 库用于 SQL:
import pandasql import sqldf
pysqldf = lambda q: sqldf(q, globals())
df = pd.DataFrame({'a': [1,2,4,3,6,1,2], 'b': ['a','a','b','b','c','c','c']})
这适用于单线程:
sorted_df = pysqldf("select * from df order by b, a")
当我应用多处理来处理 df 中的每个块时,它不起作用 并行:
def parallelize_dataframe(df, func):
unique_bs = df.b.unique().tolist()
df_split = [df[df.a == l] for l in unique_bs]
df = pd.concat(pool.map(func, df_split))
pool = Pool(num_cores)
pool.close()
pool.join()
return df
def sort_chunks(data):
sorted_data = pysqldf("select * from data order by b, a")
return sorted_data
sorted_df = parallelize_dataframe(df, sort_chunks)
我得到的错误如下:
PandaSQLException: (sqlite3.OperationalError) no such table: data [SQL:'select * from data'](此错误的背景: http://sqlalche.me/e/e3q8)
我明白错误告诉我什么。基本上,在数据库中找不到每个处理器中的数据 DF。我不确定这个问题的解决方法是什么。任何输入将不胜感激。谢谢你。
【问题讨论】:
标签: python pandas multiprocessing pandasql