【发布时间】:2022-01-11 07:23:01
【问题描述】:
我有这 30 个 GiB SAS7BDAT 文件,它们对应于一年的数据。当我尝试使用 pd.read_sas() 导入文件时,出现与内存相关的错误。经过研究,我听到有人提到使用 Dask,将文件分割成更小的块或 SQL。这些答案听起来很广泛,而且由于我是新手,我真的不知道从哪里开始。如果有人可以与我分享一些细节,将不胜感激。谢谢。
【问题讨论】:
-
我会尝试将其转换为 SQLite 数据库
-
还要考虑是否可以将大部分数据过滤或流式聚合成“更小、更易于管理”的数据集,而无需在原始整体中使用。如果是这样,这可以作为一次性流式预处理步骤来完成。
-
有时你必须购买硬件来匹配数据。
-
请编辑问题以将其限制为具有足够详细信息的特定问题,以确定适当的答案。
标签: sql pandas database sas dask