【发布时间】:2020-09-08 19:49:35
【问题描述】:
我正在提取的数据将生成一个大约有 1.5B 行的文件。
我正在考虑应该使用什么系统来分析数据。数据结构非常简单。
我正在考虑使用像 Spark 这样的分布式系统或像 DataTables 这样的 R 系统来处理数据。
假设我在一台有大量内存的机器上,我可以在 R 中使用带有 DataTables 的 50GB / 1.5B 行数据集吗?
【问题讨论】:
-
也许我可以通过减少编号来减小文件大小。我在任何时候都在使用的列数