MySQL 查询太慢，我该如何改进？-6ren

MySQL 查询太慢，我该如何改进？

转载作者：可可西里更新时间：2023-11-01 08:09:58

24

4

我有这个查询，在一个有 ~300.000 行的表上提取数据需要大约 14 秒。
该表将在不久的将来增加其大小……超过一百万行。
我使用了 EXISTS 子句而不是 IN 子句，我给出了改进。
但是查询太慢了。
你有什么解决办法吗？
提前致谢。

这是查询:

SELECT 
    flow,
    COUNT(*) tot
FROM
    (
        SELECT 
            ff.session_id,
            GROUP_CONCAT(ff.page, '#', ff.snippet_params,'$',ff.is_lead SEPARATOR '|') flow 
            FROM table_a ff
            WHERE EXISTS 
                (
                    SELECT
                        f.session_id
                    FROM table_a f
                    WHERE f.session_id = ff.session_id
                    AND f.is_lead = 1
                    GROUP BY f.user_id 
                    ORDER BY f.user_id, f.`timestamp` 
                )
            GROUP BY ff.user_id 
            ORDER BY ff.user_id, ff.`timestamp`, ff.session_id 
    )
AS flow
GROUP BY flow 
ORDER BY tot DESC LIMIT 10

这是解释:

id  select_type         table       type    possible_keys       key         key_len  ref                              rows  Extra                                         
------  ------------------  ----------  ------  ------------------  ----------  -------  -----------------------------  ------  ----------------------------------------------
 1  PRIMARY             <derived2>  ALL     (NULL)              (NULL)      (NULL)   (NULL)                            532  Using temporary; Using filesort               
 2  DERIVED             ff          ALL     (NULL)              (NULL)      (NULL)   (NULL)                         322154  Using temporary; Using filesort               
 3  DEPENDENT SUBQUERY  f           ref     is_lead,session_id  session_id  767      ff.session_id       3  Using where; Using temporary; Using filesort

最佳答案

ORDER BY 中的额外表达式没有任何意义，因为“GROUP BY user_id”将保证 user_id 的唯一值。
ORDER BY 操作在 GROUP BY 操作之后应用。如果我的意图是为每个 session_id 获得最低的 user_id ，我将使用 MIN 聚合。在原始查询中，ORDER BY 对返回哪个 session_id 没有任何影响。 session_id 返回的值不确定。

(其他数据库会在此查询中引发错误。特定于 MySQL 的 GROUP BY 扩展允许查询运行，但我们可以通过在 sql_mode 中包含 ONLY_FULL_GROUP_BY 来获得更标准的行为。)

EXISTS 子查询中的 GROUP BY 没有任何意义。如果找到行，则存在一行。无需执行 GROUP BY 并聚合找到的行。

更仔细地观察，似乎不需要在 SELECT 列表中返回 session_id 。 (在 flow View 查询或 EXISTS 子查询中。)

如果我们删除无关的语法并将查询精简到其本质，即真正重要的部分，我们将得到一个如下所示的查询:

 SELECT flow.flow  AS flow
      , COUNT(*)   AS tot
   FROM (
          SELECT GROUP_CONCAT(ff.page,'#',ff.snippet_params,'$',ff.is_lead SEPARATOR '|') AS flow
            FROM table_a ff
           WHERE EXISTS
                 ( SELECT 1
                     FROM table_a f
                    WHERE f.is_lead = 1
                      AND f.session_id = ff.session_id
                 )
           GROUP BY ff.user_id
        ) flow
  GROUP BY flow.flow
  ORDER BY tot DESC
  LIMIT 10

该查询基本上是说从(不幸命名的表) table_a 中获取所有行，这些行的 session_id 与 table_a 中的至少一行匹配， session_id 的值也相同， is_lead 的值也为 1。

然后获取所有找到的行，并根据 user_id 列中的值聚合它们。

GROUP_CONCAT 中没有 ORDER BY 很奇怪，没有 DISTINCT 关键字有点奇怪。

GROUP_CONCAT 聚合返回不确定的行顺序，并且还可能包含重复值，这很奇怪。 (假设外部查询将根据从该 GROUP_CONCAT 聚合返回的值执行另一个聚合。)

但是，我不确定这个查询应该回答什么问题。我不知道什么是独特的，什么不是。

我们知道 EXISTS 子查询可以重写为 JOIN 操作:

 SELECT flow.flow  AS flow
      , COUNT(*)   AS tot
   FROM (
          SELECT GROUP_CONCAT(ff.page,'#',ff.snippet_params,'$',ff.is_lead SEPARATOR '|') AS flow
            FROM ( SELECT d.session_id
                     FROM table_a d
                    WHERE d.is_lead = 1
                    GROUP BY d.session_id
                 ) e
            JOIN table_a ff
              ON ff.session_id = e.session_id
           GROUP BY ff.user_id
        ) flow
  GROUP BY flow.flow
  ORDER BY tot DESC
  LIMIT 10

我们可以努力使查询运行得更快。但在我这样做之前，我想确保查询返回一个与规范匹配的集合。我需要确保查询实际上是在回答它旨在回答的问题。

我怀疑原始查询不正确。也就是说，我认为如果查询返回“正确”的结果，它是意外地这样做，而不是因为它可以保证。或者因为表中行的唯一性(基数)有一些特殊之处，或者由于处理行的意外顺序。

在我花时间调整它并添加索引之前，我想确保查询能保证返回正确的结果。

问:为什么 ORDER BY 中没有 GROUP_CONCAT ？例如

 GROUP_CONCAT( foo ORDER BY something)

问:没有 DISTINCT 关键字是否有特定原因？

 GROUP_CONCAT(DISTINCT foo ORDER BY something)

问:我们是否应该关注 GROUP_CONCAT(悄悄地)返回截断值的可能性？ (基于 group_concat_max_length 变量的设置？)

跟进

为了获得上述答案中最后一个查询的最佳性能，我建议添加以下索引:

 ... ON table_a (session_id, is_lead, page, snippet_params)

或任何类似的索引，以 session_id 和 is_lead 作为前导列(按此顺序)，还包括 page 和 snippet_params 列。如果将 ORDER BY 添加到 GROUP_CONCAT，我们可能需要一个稍微不同的索引。

对于外部查询，无法绕过派生 flow 列的“使用文件排序”操作。 (除非您正在运行更新版本的 MySQL，其中可能会创建索引。或者我们愿意将查询分解为两个单独的操作。一个查询将内联 View 具体化为一个表，第二个查询要运行反对。)

关于MySQL 查询太慢，我该如何改进？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/39626801/

24

4

0

文章推荐： mysql - 带有索引列的 MySQL 查询非常缓慢

文章推荐： c# - 堆栈展开时嵌套异步方法中的堆栈溢出异常

文章推荐： MySQL 的 UTF-8 字符支持

文章推荐： android - 相框开发android

检查不良做法/改进
我对编码还比较陌生，但并非完全没有经验。处理有关金融计算器的学校作业。如果你们中的任何人可以查看我的代码以了解不良做法/可能的改进等，那就太好了。我确实添加了一个“动画”启动(有很多 printf
小目标检测改进拆分拼接
小目标Trick 论文链接： https://paperswithcode.com/paper/slicing-aided-hyper-inference-and-fine-tuning 代码链接：h
javascript - 改进 if 语句链
if (firstPositionCpc && (firstPosition > 0 && firstPositionCpc 0 && topOfPageCpc 0 && firstPageCpc
SQL 改进 - UNION？
我有 2 个表:“packages”和“items”。 “packages”有以下列:pack_id | item_id “items”有以下列......:item_id |输入一个包可以有多个
python - Pandas 改进
我目前有一个 Pandas Dataframe，我在其中执行列之间的比较。我发现一种情况，在进行比较时存在空列，由于某种原因比较返回 else 值。我添加了一个额外的语句来将其清理为空。看看我是否可以
具有四舍五入的主日期时间键的 MySQL 改进
我正在处理一个查询，通过首先舍入它们的主要日期时间键来连接一个数据库中的多个表。数据库包含来自 openhab 的性能数据，每个表只有一个名为 Time 的主日期时间行和一个名为 Value 的值行。
即发即弃的 C# 改进
问候我有一个程序创建一个类的多个实例，在所有实例上运行相同的长时间运行的 Update 方法并等待完成。我从 this question 开始关注 Kev 的方法将更新添加到 ThreadPool.
c - 对我的简单二十一点程序的建议/改进
我想在下学期的类(class)中取得领先，所以我制作了这个基本版本的 Blackjack 来开始理解 C 的基础知识，我希望您有任何想法可以帮助我更好地理解 C 和其正常的编码实践。 C 中的很多东西
javascript - 需要更好的解决方案/改进
我有一个要求，比如: 给定一个数组，其中包含随机数。需要输出元素出现的次数，有自带解决方案: var myArr = [3,2,1,2,3,1,4,5,4,6,7,7,9,1,123,0,123];
sql - min() 改进
这是我的数据库项目。表user_ select id, name from user_; id | name ----+---------- 1 | bartek 2 | bartek
bash - 改进 for 循环的执行
我已经完成了一个小批量脚本来调整(动态)一些图像的大小: for a in *.{png,PNG,jpg,JPG,jpeg,JPEG,bmp,BMP} ; do convert "$a" -resiz
列表理解中函数的 Pythonic 改进？
是否有更 pythonic 的方法来执行以下代码？我想在一行中完成 parsed_rows 是一个可以返回大小为 3 或 None 的元组的函数。 parsed_rows = [ parse_row(
选项转换器的 Javascript 改进
关闭。这个问题是opinion-based .它目前不接受答案。想要改进这个问题？更新问题，以便 editing this post 可以用事实和引用来回答它. 关闭 9 年前。 Improv
python - 列表到字典 - 改进？
下面的代码完成了我想要的，但还有其他更像 python 风格的方式吗？文件格式: key1:value1,key2:value2,... key21:value21,key22:value22,..
java - 检查字符串中是否存在字符集 - 改进
如果两个英文单词只包含相同的字母，则它们是相似的。例如，food 和 good 不相似，但 dog 和 good 相似。 (如果A与B相似，则A中的所有字母都包含在B中，B中的所有字母都包含在A中。)
c - 强平衡树 - 改进
我有以下结构来表示二叉树: typedef struct node *pnode; typedef struct node { int val; pnode left; pnode
algorithm - 改进 a* 搜索以在三角环境中寻找路径
我有一个区域，它由受约束的 delaunay 三角剖分表示。我正在解决在两点之间寻找路径的问题。我正在使用 Marcelo Kallmann 提供的论文作为解决此问题的引用点。然而，而不是使用 Kal
java - 使用正则表达式的性能开销/改进
如果我需要检查文本(字符串)中是否存在单词 A 或单词 B，如果我这样做会有性能差异: if(text.contains(wordA) || text.contains(wordB)) 要使用一些正则
xml - Xpath 改进
Adjust To 我有上面这个简单的页面，上面有一个标签和一个文本框。我想在文本框中输入文本。对我有帮助的 XPATH 是 //*[contains(tex
elisp - 改进 Elisp 条件表达式
以下伪代码的elisp代码 if "the emacs version is less than 23.1.x" do something else something-else 写成 (if

首页

博学

6Ren·AI

商城

MySQL 查询太慢，我该如何改进？