【发布时间】:2020-03-06 18:04:38
【问题描述】:
dplyr 函数通常具有令人难以置信的性能,已由开源 R 社区进行了优化,许多函数甚至在后台运行 c++ 以使它们大大更快。
通过bigrquery 和dbplyr 生成的BigQuery 代码是否接受了任何优化,或者它是否只是生成了可以(未优化)的sql? (注意bigrquery 和dbplyr 和dplyr 一样都是tidyverse 包,都是由dplyr 作者Hadley Wickham 编写的)
背景
我对如何优化生成的 BigQuery 代码很感兴趣,因为我试图决定是否值得进一步优化由 手动 重写一些 BigQuery 代码(而不是使用那些包)。如果我不太可能看到巨大的性能改进,我不会花时间这样做。
查询示例
library(dplyr)
natality <- tbl(con, "natality")
natality %>%
select(year, month, day, weight_pounds) %>%
head(10) %>%
collect()
【问题讨论】:
-
您查看过由
dbplyr生成的自动生成的bigrquery/sql代码吗? -
@Simon.S.A.好点子。我已经试过了。我看到的是复杂的 BigQuery 代码,所以我无法判断它是否经过优化
标签: r dplyr google-bigquery dbplyr bigrquery