这里的重要部分是要有一个匹配索引。你可以试试这个小测试设置:
创建架构x用于测试:
-- DROP SCHEMA x CASCADE; -- to wipe it all for a retest or when done.
CREATE SCHEMA x;
CREATE TABLE x.tbl(id serial, name text);
插入 10000 个随机行:
INSERT INTO x.tbl(name) SELECT 'x' || generate_series(1,10000);
插入另外 10000 行重复名称:
INSERT INTO x.tbl(name) SELECT 'y' || generate_series(1,10000)%20;
删除随机 10% 使其更真实:
DELETE FROM x.tbl WHERE random() < 0.1;
ANALYZE x.tbl;
查询可能如下所示:
SELECT *
FROM x.tbl
WHERE name = 'y17'
ORDER BY id DESC
LIMIT 1;
--> 总运行时间:5.535 毫秒
CREATE INDEX tbl_name_idx on x.tbl(name);
--> 总运行时间:1.228 毫秒
DROP INDEX x.tbl_name_idx;
CREATE INDEX tbl_name_id_idx on x.tbl(name, id);
--> 总运行时间:0.053 毫秒
DROP INDEX x.tbl_name_id_idx;
CREATE INDEX tbl_name_id_idx on x.tbl(name, id DESC);
--> 总运行时间:0.048 毫秒
DROP INDEX x.tbl_name_id_idx;
CREATE INDEX tbl_name_idx on x.tbl(name);
CLUSTER x.tbl using tbl_name_idx;
--> 总运行时间:1.144 毫秒
DROP INDEX x.tbl_name_id_idx;
CREATE INDEX tbl_name_id_idx on x.tbl(name, id DESC);
CLUSTER x.tbl using tbl_name_id_idx;
--> 总运行时间:0.047 毫秒
结论
使用合适的索引,查询的执行速度快了 100 倍以上。
表现最佳的是多列索引,过滤列在前,排序列在后。
在这种情况下,匹配索引中的排序顺序会有所帮助。
聚类有助于简单的索引,因为仍然需要从表中读取许多列,并且可以在聚类后在相邻块中找到这些列。在这种情况下,它对多列索引没有帮助,因为只需从表中获取一条记录。
阅读有关multicolumn indexes in the manual 的更多信息。
所有这些影响都随着表格的大小而增长。 10000 行的两个小列只是一个非常小的测试用例。