【发布时间】:2022-01-06 08:24:16
【问题描述】:
我在 hive 上使用以下查询
cur.execute('select * from table_name)
并将数据放入 pandas 数据框
output_dataframe = pd.DataFrame(cur.fetchall(),columns=colname)
我运行的表通常具有从 100 万到超过 8000 万的行/条目记录,并且代码对于较小的表工作正常,但我的大部分运行时间都用于这一步“output_dataframe = pd.DataFrame( cur.fetchall(),columns=colname)"
对于较大的表(超过 4-5 百万个条目),代码会卡住或花费数小时
在我的情况下,有没有更好的选择来改善运行时间?
【问题讨论】:
标签: python pandas dataframe hive