【发布时间】:2022-06-18 04:50:04
【问题描述】:
在 Big Query 中,我有一个包含 608 GB 数据、5000 万行和 2651 列的表。在进行任何建模之前,我正在尝试将其作为熊猫数据框加载到 Jupyter Lab 中。我正在使用 %%bigquery 将查询结果保存到 pandas 数据框中作为目的地。但是,由于尺寸很大,我遇到了错误。我遵循了文档 here 和一些建议使用 LIMIT 和设置 query.allow large results = True 的 stackoverflow 讨论 (this)。但是,我无法确定如何将它们应用于我的具体问题。
请多多指教。
谢谢。
【问题讨论】:
-
我很想建议我们着眼于总体目标而不是这种技术方法。一旦数据在 Jupyter 中,您打算如何处理这些数据?您是否可以“在”BigQuery 本身中进行处理,而不是从 BigQuery 中导出然后进行处理?
标签: python google-bigquery jupyter-notebook