【问题标题】:Join two tables using id and descendants from tree like table使用树状表中的 id 和后代连接两个表
【发布时间】:2013-05-20 10:16:01
【问题描述】:

我有以下表格:

CREATE TABLE element (
  element_id serial PRIMARY KEY,
  local_id integer,
  name varchar,
  CONSTRAINT fk_element_local_id FOREIGN KEY (local_id)
      REFERENCES local (local_id) MATCH SIMPLE
      ON UPDATE NO ACTION ON DELETE NO ACTION
);

CREATE TABLE local (
  local_id serial PRIMARY KEY,
  parent_id integer,
  name varchar,
  CONSTRAINT fk_local_parent_id_local_id FOREIGN KEY (parent_id)
      REFERENCES local (local_id) MATCH SIMPLE
      ON UPDATE CASCADE ON DELETE SET NULL
);

CREATE TABLE category (
  category_id serial PRIMARY KEY,
  name varchar
);

CREATE TABLE action (
  action_id serial PRIMARY KEY,
  local_id integer,
  category_id integer,
  CONSTRAINT fk_action_local_id FOREIGN KEY (local_id)
      REFERENCES local (local_id) MATCH SIMPLE
      ON UPDATE NO ACTION ON DELETE NO ACTION,
  CONSTRAINT fk_action_element_id FOREIGN KEY (element_id)
      REFERENCES element (element_id) MATCH SIMPLE
      ON UPDATE NO ACTION ON DELETE NO ACTION
);

我想从一个动作中选择所有元素。如果元素的局部是动作局部的后代,它也应该出现。
示例:

local

|local_id | parent_id | name |
|---------+-----------+------|
|1        |NULL       |A     |
|2        |1          |B     |
|3        |1          |C     |
|4        |3          |D     |
|5        |NULL       |E     |
|6        |5          |F     |
|_________|___________|______|

category:

| category_id | name |
|-------------+------|
|1            |A     |
|2            |B     |
|2            |C     |
|_____________|______|

element:

|element_id | local_id | name | category_id |
|-----------+----------+------+-------------|
|1          |1         |A     | 1           |
|2          |2         |B     | 2           |
|3          |2         |C     | 1           |
|4          |4         |D     | 2           |
|5          |5         |E     | 2           |
|6          |6         |F     | 1           |
|7          |6         |G     | 1           |
|___________|__________|______|_____________|

action:

|action_id | local_id | category_id |
|----------+----------+-------------|
| 1        | 1        | 2           |
| 2        | 3        | 1           |
| 3        | 5        | 1           |
| 4        | 6        | 1           |
|__________|__________|_____________|

我想要的查询结果:

CASE: action_id = 1
return: element_id: 2,4

CASE: action_id = 2
return: element_id: null

CASE: action_id = 3
return: element_id: 6,7

我已经创建了一个函数,它返回包括实际节点在内的所有后代,但由于调用该函数数千次时的性能,我遇到了困难。 我的函数如下所示:

CREATE OR REPLACE FUNCTION fn_local_get_childs(_parent_id integer)
  RETURNS SETOF integer AS
$BODY$
DECLARE
   r integer;
BEGIN
   FOR r IN SELECT local_id FROM local WHERE local_id IN ( 
      (WITH RECURSIVE parent AS
      (
         SELECT local_id , parent_id  from local WHERE local_id = _parent_id
         UNION ALL 
         SELECT t.local_id , t.parent_id FROM parent
         INNER JOIN local t ON parent.local_id =  t.parent_id
      )
      SELECT local_id FROM  parent
      ) 
   )
   LOOP
      RETURN NEXT r;
   END LOOP;
   RETURN;        
END;
$BODY$
  LANGUAGE plpgsql VOLATILE
  COST 100
  ROWS 1000;

我的超慢查询如下所示:

select e.element_id, a.action_id
from action a
join element e on (
                   e.local_id=any(select fn_local_get_childs(a.local_id)) AND 
                   e.category_id=a.category_id)

有没有办法在单个查询中组合函数中使用的递归?

【问题讨论】:

  • 由于您的 PL/PgSQL 函数是单个查询的简单包装器,请将其替换为声明为 STABLELANGUAGE sql 函数(因为它似乎是)但 不是我>STRICT。然后查询计划器可以内联查询。检查explain analyze 输出(将其粘贴到此处,保留格式,或粘贴到explain.depesz.com 并将链接放在这里),看看会发生什么。
  • 1) 为什么要使用函数? 2) 为什么在 plpgsql 中可以用纯 SQL 完成? 3) 将IN(...) 子查询替换为EXISTS(...) 子查询(或普通JOIN)
  • 有一些方法可以将递归集成到您的查询中。最快的方法取决于细节。表的基数?递归的深度。品类分布?您需要在结果中添加其他列吗?您想要示例所建议的所有行,还是有其他标准只选择少数几个?

标签: sql database postgresql plpgsql postgresql-9.2


【解决方案1】:

整合查询

在多个地方改进逻辑,您可以将整个操作集成到一个查询中。包装成 SQL 函数是可选的:

CREATE OR REPLACE FUNCTION f_elems(_action_id integer)
  RETURNS SETOF integer AS
$func$
   WITH RECURSIVE l AS (
      SELECT a.category_id, l.local_id
      FROM   action a
      JOIN   local  l USING (local_id)
      WHERE  a.action_id = $1

      UNION ALL 
      SELECT l.category_id, c.local_id
      FROM   l
      JOIN   local c ON c.parent_id = l.local_id  -- c for "child"
      )
   SELECT e.element_id
   FROM   l
   JOIN   element e USING (category_id, local_id);
$func$  LANGUAGE sql STABLE;

为给定action_id 的相同和子本地检索所有element_id

呼叫:

SELECT * FROM f_elem(3);

element_id
-----------
6
7

dbfiddle here
OLD sqlfiddle

由于多种原因,这应该大大更快了。最明显的是:

  • 用纯 SQL 代替 plpgsql 中的慢循环。
  • 缩小递归查询的起始集。
  • 删除不必要且非常慢的 IN 构造。

我用SELECT * FROM ... 而不是SELECT 调用,即使该行只有一个列,以获取我在函数头中声明的OUT 参数(element_id) 的列名。

更快,但

指数

action.action_id 上的索引由主键提供。

但您可能错过了local.parent_id 上的索引。在此过程中,将其设为覆盖多列索引(Postgres 9.2+),parent_id 作为第一个元素,local_id 作为第二个元素。如果表 local 很大,这应该会有很大帮助。对于一张小桌子来说没有那么多或根本没有:

CREATE INDEX l_mult_idx ON local(parent_id, local_id);

为什么?见:

最后,multi-column index 桌子上的 element 应该会有所帮助:

CREATE INDEX e_mult_idx ON element (category_id, local_id, element_id);

第三列element_id 仅用于使其成为覆盖索引。如果您的查询从表 element 中检索到更多列,您可能需要向索引添加更多列或删除 element_id。两者都可以让它更快。

物化视图

如果您的表格收到的更新很少或没有更新,提供共享同一类别的所有对 (action_id, element_id) 的预先计算集的物化视图将使这闪电般快速。将(action_id, element_id)(按此顺序)设为主键。

【讨论】:

    猜你喜欢
    • 2023-04-09
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-06-09
    • 2015-01-05
    相关资源
    最近更新 更多