【问题标题】:MySQL numbering records by group - did I hit a bug?MySQL 按组编号记录 - 我遇到错误了吗?
【发布时间】:2015-11-17 10:49:27
【问题描述】:

我正在尝试对 MySQL(Ubuntu 上的 5.5.44-0)中的一些记录进行编号,并按另一列分组(您将在下面看到我的意思)。我正在调整Running Sums for Multiple Categories in MySQL 中描述的解决方案,除了我只是编号,而不是求和。

所涉及的表非常庞大,有近 100 列,因此让我们首先通过创建只包含重要列的派生表来简化演示。很抱歉没有共享 SQL Fiddle,因为除非处理大量数据,否则它看起来不可复制,我无法共享:

创建表格:

CREATE TABLE `inquiries_test` (
  `id` int(11) NOT NULL DEFAULT '0',
  `motive` varchar(255) CHARACTER SET utf8 DEFAULT NULL,
  PRIMARY KEY (`inquiry_id`),
  KEY `motive` (`motive`)
);

insert into inquires_test select id, motive from inquiries;

CREATE TABLE `leads_test` (
  `lead_id` int(11) DEFAULT NULL,
  `created_at` datetime DEFAULT NULL,
  `inquiry_id` int(11) DEFAULT NULL,
  KEY `id` (`lead_id`)
);

insert into leads_test select lead_id, created_at, inquiry_id;

CREATE TABLE `lead_inserts` (
  `lead_id` int(11) DEFAULT NULL,
  `created_at` datetime DEFAULT NULL,
  `cnt` int(11) DEFAULT NULL
);

您会注意到上面的inquiries_test 和leads_test 的数据来自实际的生产表。这一点的重要性将在以后发挥。现在填充lead_inserts:

playground>insert into lead_inserts (cnt, created_at, lead_id) 
    -> SELECT @cnt := if(@id = l.lead_id,@cnt,0) + 1 as cnt 
    -> , l.created_at 
    -> , @id := l.lead_id as local_resouce_id
    -> FROM leads_test l join inquiries_test i on (l.inquiry_id=i.id)
    -> CROSS JOIN (select @id := 0, @cnt := 0) as InitVarsAlias 
    -> where i.motive='real' ORDER BY lead_id, created_at;
Query OK, 2172774 rows affected (14.30 sec)
Records: 2172774  Duplicates: 0  Warnings: 0

playground>select * from lead_inserts where lead_id in (117,118);
+---------+---------------------+------+
| lead_id | created_at          | cnt  |
+---------+---------------------+------+
|     117 | 2012-06-23 00:13:09 |    1 |
|     117 | 2014-09-14 04:30:37 |    2 |
|     117 | 2015-01-27 22:34:41 |    3 |
|     117 | 2015-03-19 19:33:51 |    4 |
|     118 | 2014-12-24 17:47:15 |    1 |
|     118 | 2015-01-23 21:30:09 |    2 |
|     118 | 2015-04-07 21:33:43 |    3 |
|     118 | 2015-04-10 17:00:04 |    4 |
|     118 | 2015-05-12 21:59:49 |    5 |
+---------+---------------------+------+

到目前为止一切顺利 - 每个新的lead_id 的 cnt 值都会“重置”。现在考虑到leads_test 和inquiries_tests 基本上是删除了其他列的leads 和inquiries,如果我修改insert 语句以使用原始表,结果应该是一样的,对吗?但是看:

playground>truncate table lead_inserts;
Query OK, 0 rows affected (0.14 sec)

playground>insert into lead_inserts (cnt, created_at, lead_id) 
    -> SELECT @cnt := if(@id = l.lead_id,@cnt,0) + 1 as cnt 
    -> , l.created_at 
    -> , @id := l.lead_id as local_resouce_id
    -> FROM leads l join inquiries i on (l.inquiry_id=i.id)        
    -> CROSS JOIN (select @id := 0, @cnt := 0) as InitVarsAlias 
    -> where i.motive='real' ORDER BY lead_id, created_at;
Query OK, 2172774 rows affected (17.25 sec)
Records: 2172774  Duplicates: 0  Warnings: 0

playground>select * from lead_inserts where lead_id in (117,118);
+---------+---------------------+------+
| lead_id | created_at          | cnt  |
+---------+---------------------+------+
|     117 | 2012-06-23 00:13:09 |    1 |
|     117 | 2014-09-14 04:30:37 |    1 |
|     117 | 2015-01-27 22:34:41 |    1 |
|     117 | 2015-03-19 19:33:51 |    1 |
|     118 | 2014-12-24 17:47:15 |    1 |
|     118 | 2015-01-23 21:30:09 |    1 |
|     118 | 2015-04-07 21:33:43 |    1 |
|     118 | 2015-04-10 17:00:04 |    1 |
|     118 | 2015-05-12 21:59:49 |    1 |
+---------+---------------------+------+

编号怎么了?使用原始表格时的其他观察结果:

  1. 如果我不处理所有记录并仅指定几个lead_id,则计算结果正确。
  2. 如果我删除 INSERT 子句并将其作为选择运行(使用 LIMIT 子句仅显示 50 行输出),则计算结果正确。

那么,这是我遇到的错误,还是我遗漏了什么?在现实生活中,我不能将上述过程用作解决方法 - 我真的必须使用潜在客户和查询,因为这些表中的其他列必须是lead_inserts 的一部分。

谢谢!

【问题讨论】:

  • 我认为正在发生的是 MySQL 优化了您的查询。它认为没有理由对您的记录进行排序,因为目标表中没有 AUTO-INCREMENT 列。也没有聚集索引。 MySQL 无法分析您的计数器变量,因此认为不需要 ORDER BY。我认为您要么需要使用子查询:insert into lead_inserts (cnt, created_at, lead_id ) SELECT * FROM (SELECT @cnt := if(@id = l.lead_id,@cnt,0) + 1 as cnt ....) as a,要么将自动增量列添加到 lead_inserts
  • 两者都不起作用:(而且,除非我遗漏了什么,否则您提出的解决方案无法解释为什么我的语句适用于派生测试表而不适用于实时测试表。但感谢您尝试帮助!
  • 你是对的 - 这是一个优化的东西。添加 FORCE INDEX FOR ORDER BY 子句似乎已经成功了。尽管您提出的解决方案不起作用,但关于优化的最初评论为我指明了正确的方向。谢谢!

标签: mysql sql group-by cross-join


【解决方案1】:

A Cha 指出,看起来这是 MySQL 优化的事情,当最终结果将被插入到新表时,MySQL 没有理由执行 ORDER BY。为什么它适用于测试表而不是生产表,当它们具有相同的行数时,我不知道。但这就是我强制它对要插入的内容进行排序的方式:

首先确保我要排序的列有一个连接索引:

CREATE INDEX idx_leads_lead_id_created ON leads(lead_id, created_at);

然后强制 MySQL 使用这个索引:

insert into lead_inserts (cnt, created_at, lead_id) 
SELECT @cnt := if(@id = l.lead_id,@cnt,0) + 1 as cnt 
, l.created_at 
@id := l.lead_id as local_resouce_id
FROM leads l FORCE INDEX FOR ORDER BY (idx_leads_lead_id_created)
JOIN inquiries i on (l.inquiry_id=i.id)        
CROSS JOIN (select @id := 0, @cnt := 0) as InitVarsAlias 
WHERE i.motive='real' 
ORDER BY lead_id, created_at;

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-05-11
    • 2016-02-10
    • 2013-03-22
    • 1970-01-01
    • 2015-06-18
    • 2019-03-26
    相关资源
    最近更新 更多