performance - PostgreSQL 9.2 - Agg 查询速度慢，计数(distinct x)-6ren

performance - PostgreSQL 9.2 - Agg 查询速度慢，计数(distinct x)

转载作者：行者123 更新时间：2023-11-29 13:34:48

我们正处于从 MySQL 到 PG 9.2 的转换过程中。然而，我们在 PG 中的聚合查询遇到了障碍。与 MySQL 相比，它们在 PG 中运行的时间要长得多。我认为导致最大问题的是我们在聚合查询中的 count(distinct x)。这会导致额外的排序，无论我们将 WORK_MEM 设置为什么，它都会溢出到磁盘上。我们还尝试将 enable_sort 设置为“关闭”并将 enable_seqscan 设置为“关闭”。此外，我们定期运行 VACUUM ANALYZE。最后，我们无法利用索引，因为我们的查询有许多暗淡的字段，而且其中大部分是连接在一起的。表是 40 到 80 磨。请任何建议会有所帮助!这是解释分析的示例。

查询

SELECT
    concat(
        cast(coalesce(trim(tablea.state_id),'na') as varchar),
        '-',
        cast(
            coalesce(
                CASE WHEN char_length(cast(tablea.case_num as varchar)) = 12
                    THEN left(cast(tablea.case_num as varchar), 2)
                    else left(cast(tablea.case_num as varchar), 1)
                END,'na'
            ) as varchar
        )
    ),
    to_char(tablea.visit_date,'yyyy-mm-01') ,
    coalesce(tablea.payor_code,0) ,
    coalesce(tablea.los,'other') ,
    case when cpt_group is null or cpt_group = ''
        then '0'
        else split_part(tablea.cpt_group,'-',1)
    end ,
    case when cpt_group is null or cpt_group = ''
        then '0'
        else split_part(tablea.cpt_group,'-',2)
    end ,
    case when (tablea.erp_code) isnull
        then 'na'
        else concat(
            cast(coalesce(trim(tablea.state_id), 'na') as varchar),
            '-',
            coalesce(cast(tablea.erp_code as varchar), 'na') ,
            '-',
            coalesce(cast(tablea.mlp_code as varchar), 'na')
            )
    end ,
    coalesce(tablea.erp_attnd,'n') ,
    count(distinct concat(tablea.state_id,tablea.case_num)) ,
    count( unique_rec_id),
    sum(tablea.units) ,
    sum(tablea.total_amt) ,
    sum(tablea.total_rvu) ,
    sum(tablea.budget_rvu),
    sum(tablea.work_rvu) ,
    sum(tablea.payroll_rvu) ,
    sum(extract(day from charges.insert_ts - charges.visit_date))
FROM tablea
GROUP BY 1,2,3,4,5,6 ,7 ,8

表结构

state_id character varying(8),
unique_rec_id bigint NOT NULL,
case_num bigint,
seq_nbr smallint,
charge_code character varying(18),
cpt_type character varying(2),
cpt_code character varying(19),
cpt_version_code character varying(2),
erp_code integer,
mlp_code integer,
shared_svcs character varying(1),
visit_date date,
units numeric(6,2),
unit_amt numeric(7,2),
total_amt numeric(7,2),
unit_rvu numeric(6,2),
total_rvu numeric(6,2),
place_of_serv smallint,
insert_ts timestamp(6) without time zone,
update_ts timestamp(6) without time zone,
alw_amt numeric(8,2),
pmt_amt numeric(8,2),
adj_amt numeric(8,2),
payor_code smallint,
coder_id smallint,
erp_attnd character varying(1),
tos smallint,
etos smallint,
los character varying(5),
budget_rvu numeric(6,2),
work_rvu numeric(6,2),
payroll_rvu numeric(6,2),
cpt_group character varying(7),
CONSTRAINT charges_pkey PRIMARY KEY (unique_rec_id)

解释输出

"GroupAggregate  (cost=10007828904.29..10010019592.38 rows=3519178 width=77) (actual time=1270982.096..1448667.608 rows=7848213 loops=1)"
"  Output: (pg_catalog.concat((COALESCE(btrim((state_id)::text), 'na'::text))::character varying, '-', (COALESCE(CASE WHEN (char_length(((case_num)::character varying)::text) = 12) THEN "left"(((case_num)::character varying)::text, 2) ELSE "left"(((case_num)::character varying)::text, 1) END, 'na'::text))::character varying)), (to_char((visit_date)::timestamp with time zone, 'yyyy-mm-01'::text)), (COALESCE((payor_code)::integer, 0)), (COALESCE(los, 'other'::character varying)), (CASE WHEN ((cpt_group IS NULL) OR ((cpt_group)::text = ''::text)) THEN '0'::text ELSE split_part((cpt_group)::text, '-'::text, 1) END), (CASE WHEN ((cpt_group IS NULL) OR ((cpt_group)::text = ''::text)) THEN '0'::text ELSE split_part((cpt_group)::text, '-'::text, 2) END), (CASE WHEN (erp_code IS NULL) THEN 'na'::text ELSE pg_catalog.concat((COALESCE(btrim((state_id)::text), 'na'::text))::character varying, '-', COALESCE((erp_code)::character varying, 'na'::character varying), '-', COALESCE((mlp_code)::character varying, 'na'::character varying)) END), (COALESCE(erp_attnd, 'n'::character varying)), count(DISTINCT pg_catalog.concat(state_id, case_num)), count(unique_rec_id), sum(units), sum(total_amt), sum(total_rvu), sum(budget_rvu), sum(work_rvu), sum(payroll_rvu), sum(date_part('day'::text, (insert_ts - (visit_date)::timestamp without time zone)))"
"  Buffers: shared hit=866434, temp read=558843 written=558843"
"  ->  Sort  (cost=10007828904.29..10007916883.73 rows=35191776 width=77) (actual time=1270982.019..1314712.552 rows=36729163 loops=1)"
"        Output: (pg_catalog.concat((COALESCE(btrim((state_id)::text), 'na'::text))::character varying, '-', (COALESCE(CASE WHEN (char_length(((case_num)::character varying)::text) = 12) THEN "left"(((case_num)::character varying)::text, 2) ELSE "left"(((case_num)::character varying)::text, 1) END, 'na'::text))::character varying)), (to_char((visit_date)::timestamp with time zone, 'yyyy-mm-01'::text)), (COALESCE((payor_code)::integer, 0)), (COALESCE(los, 'other'::character varying)), (CASE WHEN ((cpt_group IS NULL) OR ((cpt_group)::text = ''::text)) THEN '0'::text ELSE split_part((cpt_group)::text, '-'::text, 1) END), (CASE WHEN ((cpt_group IS NULL) OR ((cpt_group)::text = ''::text)) THEN '0'::text ELSE split_part((cpt_group)::text, '-'::text, 2) END), (CASE WHEN (erp_code IS NULL) THEN 'na'::text ELSE pg_catalog.concat((COALESCE(btrim((state_id)::text), 'na'::text))::character varying, '-', COALESCE((erp_code)::character varying, 'na'::character varying), '-', COALESCE((mlp_code)::character varying, 'na'::character varying)) END), (COALESCE(erp_attnd, 'n'::character varying)), state_id, case_num, unique_rec_id, units, total_amt, total_rvu, budget_rvu, work_rvu, payroll_rvu, insert_ts, visit_date"
"        Sort Key: (pg_catalog.concat((COALESCE(btrim((charges.state_id)::text), 'na'::text))::character varying, '-', (COALESCE(CASE WHEN (char_length(((charges.case_num)::character varying)::text) = 12) THEN "left"(((charges.case_num)::character varying)::text, 2) ELSE "left"(((charges.case_num)::character varying)::text, 1) END, 'na'::text))::character varying)), (to_char((charges.visit_date)::timestamp with time zone, 'yyyy-mm-01'::text)), (COALESCE((charges.payor_code)::integer, 0)), (COALESCE(charges.los, 'other'::character varying)), (CASE WHEN ((charges.cpt_group IS NULL) OR ((charges.cpt_group)::text = ''::text)) THEN '0'::text ELSE split_part((charges.cpt_group)::text, '-'::text, 1) END), (CASE WHEN ((charges.cpt_group IS NULL) OR ((charges.cpt_group)::text = ''::text)) THEN '0'::text ELSE split_part((charges.cpt_group)::text, '-'::text, 2) END), (CASE WHEN (charges.erp_code IS NULL) THEN 'na'::text ELSE pg_catalog.concat((COALESCE(btrim((charges.state_id)::text), 'na'::text))::character varying, '-', COALESCE((charges.erp_code)::character varying, 'na'::character varying), '-', COALESCE((charges.mlp_code)::character varying, 'na'::character varying)) END), (COALESCE(charges.erp_attnd, 'n'::character varying))"
"        Sort Method: external merge  Disk: 4470728kB"
"        Buffers: shared hit=866434, temp read=558843 written=558843"
"        ->  Seq Scan on public.charges  (cost=10000000000.00..10003417837.76 rows=35191776 width=77) (actual time=0.062..182871.790 rows=36729163 loops=1)"
"              Output: pg_catalog.concat((COALESCE(btrim((state_id)::text), 'na'::text))::character varying, '-', (COALESCE(CASE WHEN (char_length(((case_num)::character varying)::text) = 12) THEN "left"(((case_num)::character varying)::text, 2) ELSE "left"(((case_num)::character varying)::text, 1) END, 'na'::text))::character varying), to_char((visit_date)::timestamp with time zone, 'yyyy-mm-01'::text), COALESCE((payor_code)::integer, 0), COALESCE(los, 'other'::character varying), CASE WHEN ((cpt_group IS NULL) OR ((cpt_group)::text = ''::text)) THEN '0'::text ELSE split_part((cpt_group)::text, '-'::text, 1) END, CASE WHEN ((cpt_group IS NULL) OR ((cpt_group)::text = ''::text)) THEN '0'::text ELSE split_part((cpt_group)::text, '-'::text, 2) END, CASE WHEN (erp_code IS NULL) THEN 'na'::text ELSE pg_catalog.concat((COALESCE(btrim((state_id)::text), 'na'::text))::character varying, '-', COALESCE((erp_code)::character varying, 'na'::character varying), '-', COALESCE((mlp_code)::character varying, 'na'::character varying)) END, COALESCE(erp_attnd, 'n'::character varying), state_id, case_num, unique_rec_id, units, total_amt, total_rvu, budget_rvu, work_rvu, payroll_rvu, insert_ts, visit_date"
"              Buffers: shared hit=866434"
"Total runtime: 1450131.131 ms"

最佳答案

我做了表面优化:

SELECT
    concat(coalesce(state_id, 'na'), '-', case_num),
    visit_date,
    coalesce(payor_code, 0),
    coalesce(los, 'other'),
    case when cpt_group_1 is null or cpt_group = ''
        then '0'
        else cpt_group_1
    end,
    case when cpt_group_2 is null or cpt_group = ''
        then '0'
        else cpt_group_2
    end,
    erp_code ,
    coalesce(erp_attnd, 'n'),
    count_case_num,
    rec_id,
    units,
    total_amt,
    total_rvu,
    budget_rvu,
    work_rvu,
    payroll_rvu,
    days
from (
    select
        tablea.state_id,
        CASE WHEN tablea.case_num between 100000000000 and 999999999999
            THEN left(cast(tablea.case_num as text), 2)
            else left(cast(tablea.case_num as text), 1)
        END case_num,
        date_trunc('month', tablea.visit_date) visit_date,
        tablea.payor_code,
        tablea.los,
        split_part(tablea.cpt_group, '-', 1) cpt_group_1,
        split_part(tablea.cpt_group, '-', 2) cpt_group_2,
        case when tablea.erp_code is null
            then 'na'
            else concat(
                coalesce(tablea.state_id, 'na'),
                '-',
                coalesce(cast(tablea.erp_code as text), 'na'),
                '-',
                coalesce(cast(tablea.mlp_code as text), 'na')
                )
        end erp_code,
        tablea.erp_attnd,
        count(distinct (tablea.state_id, tablea.case_num)) count_case_num,
        count(unique_rec_id) rec_id,
        sum(tablea.units) units,
        sum(tablea.total_amt) total_amt,
        sum(tablea.total_rvu) total_rvu,
        sum(tablea.budget_rvu) budget_rvu,
        sum(tablea.work_rvu) work_rvu,
        sum(tablea.payroll_rvu) payroll_rvu,
        sum(extract(day from charges.insert_ts - charges.visit_date)) days
    FROM tablea
    GROUP BY 1, 2, 3, 4, 5, 6 ,7 ,8, 9
) s

你担心的部分我改自:

count(distinct concat(tablea.state_id,tablea.case_num))

到:

count(distinct (tablea.state_id, tablea.case_num))

关于performance - PostgreSQL 9.2 - Agg 查询速度慢，计数(distinct x)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/15411096/

文章推荐： iphone - UISearchBar setSearchFieldBackgroundImage 问题

文章推荐： php - Mysql基于日期的查询？

Mysql 查询 JOIN 查询
我有三张 table 。表 A 有选项名称(即颜色、尺寸)。表 B 有选项值名称(即蓝色、红色、黑色等)。表C通过将选项名称id和选项名称值id放在一起来建立关系。我的查询需要显示值和选项的名称，而
查询
在mysql中，如何计算一行中的非空单元格？我只想计算某些列之间的单元格，比如第 3-10 列之间的单元格。不是所有的列...同样，仅在该行中。最佳答案如果你想这样做，只能在 sql 中使用名称而
sql - 查询、 native 查询、命名查询和类型化查询之间的区别
关闭。这个问题需要多问focused 。目前不接受答案。想要改进此问题吗？更新问题，使其仅关注一个问题 editing this post . 已关闭 7 年前。 Improve this ques
elasticsearch - 在Elasticsearch查询中没有为[查询]注册的[查询]
我正在为版本7.6进行Elasticsearch查询我的查询是这样的: { "query": { "bool": { "should": [ {
sql - 查询、 native 查询、命名查询和类型化查询之间的区别
关闭。这个问题需要多问focused 。目前不接受答案。想要改进此问题吗？更新问题，使其仅关注一个问题 editing this post . 已关闭 7 年前。 Improve this ques
php - Mysql WHERE NOT EXISTS(查询)OR(查询)
是否可以编写一个查询来检查任一子查询(而不是一个子查询)是否正确？ SELECT * FROM employees e WHERE NOT EXISTS (
javascript - 查询。为表中的每一行发送 ajax 查询
我找到了很多关于我的问题的答案，但问题没有解决我有表格，有数据，例如: Data 1 Data 2 Data 3
salesforce - SOQL 查询 - 如何通过将字段设为小写并进行比较来编写 SOQL 查询？
以下查询返回错误: 查询: SELECT Id, FirstName, LastName, OwnerId, PersonEmail FROM Account WHERE lower(PersonEm
salesforce - SOQL 查询 - 如何通过将字段设为小写并进行比较来编写 SOQL 查询？
以下查询返回错误: 查询: SELECT Id, FirstName, LastName, OwnerId, PersonEmail FROM Account WHERE lower(PersonEm
Android SQLite 查询(我想解析一般的 SQL 查询)
我从 EditText 中获取了 String 值。以及提交查询的按钮。 String sql=editQuery.getText().toString();// SELECT * FROM empl
mysql 查询 - 为一个巨大的表优化现有的 MAX-MIN 查询
我有一个或多或少有效的查询(关于结果)，但处理大约需要 45 秒。这对于在 GUI 中呈现数据来说肯定太长了。所以我的需求是找到一个更快/更高效的查询(几毫秒左右会很好)我的数据表大约有 3000
SQL 查询 - 将 NULL 结果添加到 SELECT 查询
这是我第一次使用 Stack Overflow，所以我希望我以正确的方式提出这个问题。我有 2 个 SQL 查询，我正在尝试比较和识别缺失值，尽管我无法将 NULL 字段添加到第二个查询中以识别缺失
sql - 什么是动态 SQL 查询？何时需要使用动态 SQL 查询？
什么是动态 SQL 查询？何时需要使用动态 SQL 查询？我使用的是 SQL Server 2005。最佳答案这里有几篇文章: Introduction to Dynamic SQL Dynami
php - 在另一个 mysql 查询 while 循环中调用 mysql 查询
include "mysql.php"; $query= "SELECT ID,name,displayname,established,summary,searchlink,im
java - MySQL 查询 "select top 5"查询
我有一个查询要“转换”为 mysql。这是查询: select top 5 * from (select id, firstName, lastName, sum(fileSize) as To
c# - Entity Framework 查询 ToString 不会产生 SQL 查询
通过我的研究，我发现至少从 EF 4.1 开始，EF 查询上的 .ToString() 方法将返回要运行的 SQL。事实上，这对我来说非常有用，使用 Entity Framework 5 和 6。但
MySQL 查询(或 Doctrine 1.2 查询)- 从连接表和过滤器中获取最新项目
我在构造查询来执行以下操作时遇到问题: 按activity_type_id过滤联系人，仅显示最近事件具有所需activity_type_id或为NULL(无事件)的联系人表格结构如下: 一个联系人可
php - 如何在执行另一个 SQL 查询 x 分钟后执行一个 SQL 查询？
如何让我输入数据库的信息在输入数据 5 分钟后自行更新？假设我有一张 table : +--+--+-----+ |id|ip|count| +--+--+-----+ |
database - 如何在 N1QL 查询(Couchbase 查询)中使用 LENGTH() 字符串函数
我正在尝试搜索正好是 4 位数字的 ID，我知道我需要使用 LENGTH() 字符串函数，但找不到如何使用它的示例。我正在尝试以下(和其他变体)但它们不起作用。 SELECT max(car_id)
php - 将 SQL 查询 (+JOIN) 转换为 Symfony Propel 查询
我有一个在 mysql 上运行良好的 sql 查询(查询 + 连接): select sum(pa.price) from user u , purchase pu , pack pa where (

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

performance - PostgreSQL 9.2 - Agg 查询速度慢，计数(distinct x)