【发布时间】:2021-05-11 23:57:58
【问题描述】:
在 Rstudio 会议here 上观看了令人兴奋的网络研讨会后,我非常兴奋,可以将整个 SQL 服务器表转储到 parquet 文件中。结果是 2886 个文件(37 个月内 78 个实体),总共约 7 亿行。
执行基本选择会在 15 秒内返回所有行! (简直出乎意料!)在网络研讨会上,来自 Ursa Labs 的 Neal Richardson 展示了 Ny-Taxi 数据集,该数据集在 4 秒内包含 20 亿行。
我觉得是时候做一些更大胆的事情了,比如基本均值、标准差、模式超过一年的数据,但这每月需要一分钟,所以我坐了 12.4 分钟等待 R 的回复。
有什么问题?我写得不好的 R 查询?或者只是太多的文件或粒度(十进制值?)??
有什么想法吗??
PS:我不想在 apache-arrow board 中放置 Jira-case,因为我看到 google 搜索无法从那里检索答案。
【问题讨论】:
标签: r parquet apache-arrow