【发布时间】:2021-06-01 07:57:35
【问题描述】:
我正在阅读具有大量数据的 hdf5 文件。我想将它存储在一个数据框中(它将包含大约 1.3e9 行)。目前我正在使用以下程序:
df = pd.DataFrame()
for key in ['Column1', 'Column2', 'Column3']:
df[key] = np.array(h5assembly.get(key))
我已经计时了,大约需要 110 秒
如果我只是将值分配给 numpy 数组,如下所示:
v1 = np.array(h5assembly.get('Column1'))
v2 = np.array(h5assembly.get('Column2'))
v3 = np.array(h5assembly.get('Column3'))
大约需要 22 秒。
我做错了吗?是否预计数据框的创建速度会慢得多?有什么方法可以加速这个过程?
【问题讨论】:
标签: python pandas dataframe hdf5