【发布时间】:2021-07-06 07:21:21
【问题描述】:
我想使用 R 笔记本通过 dplyr 包连接到远程 PostgreSQL 数据库。 问题是 R 函数很慢,当我查看执行计划时,我看到它没有使用表的索引,但是如果我在 PostgreSQL 中运行相同的查询,它会快得多,因为使用了索引。
在 R 中:
q <- tbl(con, "mytable")%>%
filter(a==1000, b>500)%>%
select(id) %>%
explain()
#<SQL>
#SELECT "id"
#FROM "mytable"
#WHERE (("a" = 1000.0) AND ("b" > 500.0))
#
#<PLAN>
#Seq Scan on mytable
# Filter: (((b)::numeric > 500.0) AND ((a)::numeric = 1000.0))
在同一个 R 笔记本但在一个 SQL 块中:
{sql connection=con}
EXPLAIN ANALYZE SELECT id FROM mytable WHERE a=1000 AND b>500;
#Bitmap Heap Scan on mytable
#Recheck Cond: (a = 1000)
#Filter: (b > 500)
#Rows Removed by Filter: 44963
#Heap Blocks: exact=390
#-> Bitmap Index Scan on idx_mytable_a
#Index Cond: (a = 1000)
为什么计划在使用相同连接时会有所不同?
更新
R 函数将1000 解释为1000.0,这是造成差异的原因:
{sql connection=con}
EXPLAIN ANALYZE SELECT id FROM mytable WHERE a=1000.0 AND b>500.0;
#Seq Scan on mytable
# Filter: (((b)::numeric > 500.0) AND ((a)::numeric = 1000.0))
如何避免这种转换?
【问题讨论】:
-
一个可能链接的issue
-
不同之处在于命令的构建方式。你可以尝试用括号
(解释完全相同的SQL,看看它是否仍然不同? -
感谢您的提示!我能够检测到差异的原因:dplyr 函数使用
a=1000.0创建一个查询,并将其写为a=1000。如果我将 SQL 查询写为SELECT id FROM mytable WHERE a=1000.0 AND b>500;,它确实是一个 seq 扫描。任何解决方法的想法还是可能是一个错误?
标签: r postgresql dplyr