- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我在 Postgres 中尝试检索买多于卖的目录产品的最新价格时遇到了缓慢的交易问题。此时它是一个相当大的表,超过 200 万行。我有这个用于历史目的。我目前使用的是:
select * from ta_price a
join (
select catalogproduct_id, max(timestamp) ts
from ta_price
group by catalogproduct_id
) b on a.catalogproduct_id = b.catalogproduct_id
and a.timestamp = b.ts
AND buy > sell;
catalogproduct_id 是 catalogproduct 表的外键。
在总共 2201760 行中,它选择了 2296 行。总运行时间为 181,792.705 毫秒。
关于如何改进这一点的任何见解?
编辑:
我被所有的答案震惊了!我还想在 Django ORM 的领域下更多地限定这个问题。我正在努力在此表上合并一个复合键(或类似键)(使用 catalogproduct_id 和时间戳)。我有一个主键,它是一个自动递增索引,我想这和根本没有索引一样好。
编辑 2:添加@Erwin 建议的部分索引后,在 ta_price(catalogproduct_id,时间戳)上创建索引 my_partial_idx
,我使用来自@wildplasser 的查询大约需要 10-12 秒的查询时间。为了进一步说明,我的表格是一段时间内产品价格(买卖)的快照。在任何给定时间,我想知道当前(截至其最新快照时间)哪些产品有
WHERE buy > sell;buy > sell
。
最佳答案
SELECT *
FROM ta_price a
JOIN (
SELECT catalogproduct_id, max(timestamp) ts
FROM ta_price
GROUP BY catalogproduct_id
) b ON a.catalogproduct_id = b.catalogproduct_id
AND a.timestamp = b.ts
AND a.buy > a.sell;
buy
和 sell
不符合你的问题。取决于 buy > sell
的选择性您可以通过添加相同的 WHERE
来加快查询速度- 子选择的子句。但是,这会产生不同的结果。我偶然添加它,您可能会忽略它:
SELECT *
FROM ta_price a
JOIN (
SELECT catalogproduct_id, max(timestamp) ts
FROM ta_price
WHERE buy > sell
GROUP BY catalogproduct_id
) b ON a.catalogproduct_id = b.catalogproduct_id
AND a.timestamp = b.ts
WHERE a.buy > a.sell;
无论哪种方式,像@Will 暗示的简单索引都会有所帮助:
CREATE INDEX my_idx ON ta_price (catalogproduct_id, timestamp);
不过,还有一个更好的方法。
无条件max()
在 subselect 中将导致顺序表扫描,而不管索引如何。对于 2.2m 行,这样的操作永远不会很快。JOIN
条件,结合 WHERE
外层子句SELECT
, 将从上述指数中获利。取决于 buy > sell
的选择性一个partial index在磁盘和 RAM 中会快一点或快很多,相应地,在磁盘和 RAM 中也会更小:
CREATE INDEX my_partial_idx ON ta_price (catalogproduct_id, timestamp)
WHERE buy > sell;
在这种情况下,索引中列的顺序无关紧要。它还将加快我的查询的第二个变体。
您提到该表是用于“历史”目的?如果这意味着没有新数据,您可以使用实体化 View 大大加快处理速度。
旁注:我不会使用 timestamp
作为列名。它在 PostgreSQL 中是允许的,但它是一个 reserved word在所有 SQL 标准中。
好的,要紧的事放在最后:对于一个 220 万行的表,您需要多的资源,而不是 postgres 开箱即用的资源。
shared_buffers
的设置和 work_mem
开始。增加这些统计设置:
ALTER TABLE tmp.ta_price ALTER COLUMN buy SET STATISTICS 1000;<br/>
ALTER TABLE tmp.ta_price ALTER COLUMN sell SET STATISTICS 1000;<br/>
ALTER TABLE tmp.ta_price ALTER COLUMN ts SET STATISTICS 1000;
然后运行ANALYZE tmp.ta_price;
确保autovacuum在跑。如有疑问,请运行 VACUUM ANALYZE ta_price
看看有没有效果。
我在资源有限的 pg 8.4 安装上玩过 wildplasser 的测试设置(非常有帮助!)。以下是来自 EXPLAIN ANYLYZE
的总运行时间
Erwin 1) 901.487 ms wildplasser 1) 1148.045 ms A.H. 2922.113 ms
带有附加(买入 > 卖出)子句的变体 2:
Erwin 2) 536.678 ms wildplasser 2) 809.215 ms
Erwin 1) 1166.793 ms -- slower (!), than unexpected
可能规划器成本已经关闭,这个测试数据库集群针对主数据库进行了优化有更多的资源。
wildplasser 1) 1122.609 ms -- rest is faster as expected Erwin 2) 481.487 ms wildplasser 2) 769.887 ms
A.H. 的版本需要更长的时间(与您报告的结果相同)。窗口函数往往很慢,尤其是在旧版本的 postgres 上。我的替代查询速度是预期的两倍。问题是,如果需要不同的结果 - 也许不需要。
无论如何,那是 30 万行。在 5 年前的服务器上,在资源有限(但主要是正确设置)的 8.4 版上,查询需要 0.5 - 1 秒。如果机器和设置都不错(足够的 RAM!),您应该至少将其降低到10 秒以下。
关于sql - 慢速 SQL 事务从 Postgres 中的表中获取最新的时间戳行,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/7706521/
我想知道这里是否有人有安装 Postgres-XL 的经验,新的开源多线程版本的 PostgreSQL。我计划将一组 1-2 TB 的数据库从常规 Postgres 9.3 迁移到 XL,并且想知道这
我想创建一个 postgres 备份脚本,但我不想使用 postgres 用户,因为我所在的 unix 系统几乎没有限制。我想要做的是在 crontab 上以 unix 系统(网络)的普通用户身份运行
我正在尝试编写一个 node-postgres 查询,它采用一个整数作为参数在间隔中使用: const query = { text: `SELECT foo
如何在不使用 gui 的情况下停止特定的 Postgres.app 集群。 我想使用 bash/Terminal.app 而不是 gui 我还应该指出,Postgres 应用程序有一个这样的菜单 如果
关闭。这个问题是opinion-based .它目前不接受答案。 想要改进这个问题? 更新问题,以便 editing this post 可以用事实和引用来回答它. 关闭 9 年前。 Improve
我正在使用 docker 运行 Postgres 图像。它曾经在 Windows10 和 Ubuntu 18.04 上运行没有任何问题。 在 Ubuntu 系统上重新克隆项目后,它在运行 docker
我正在使用 python(比如表 A)将批处理 csv 文件加载到 postgres。我正在使用 pandas 将数据上传到更快的 block 中。 for chunk in pd.read_csv(
所以是的,标题说明了一切,我需要以某种方式将 DB 从源服务器获取到新服务器,但更重要的是旧服务器正在崩溃 :P 有什么方法可以将它全部移动到新服务器并导入它? 旧服务器只是拒绝再运行 Postgre
这主要是出于好奇而提出的问题。我正在浏览 Postgres systemd 单元文件,以了解 systemd 可以做什么。 Postgres 有两个 systemd 单元文件。一个用于代替 syste
从我在 pg_hba.conf 中读到的内容,我推断,为了确保提示我输入 postgres 用户的密码,我应该从当前的“对等”编辑 pg_hba.conf 的前两个条目的方法'到'密码'或'md5',
我已连接到架构 apm。 尝试执行函数并出现以下错误: ERROR: user mapping not found for "postgres" 数据库连接信息说: apm on postgres@
我在 ubuntu 12.04 服务器上,我正在尝试安装 postgresql。截至目前,我已成功安装它但无法配置它。我需要创建一个角色才能继续前进,我在终端中运行了这个命令: root@hostna
我无法以“postgres”用户身份登录到“postgres”数据库。操作系统:REHL 服务器版本 6.3PostgreSQL 版本:8.4有一个数据库“jiradb”用作 JIRA 6.0.8 的
我正在尝试将现有数据库导入 postgres docker 容器。 这就是我的处理方式: docker run --name pg-docker -e POSTGRES_PASSWORD=*****
我们的 Web 应用程序在 postgres 9.3 和 Grails 2.5.3 上运行。当我们重新启动 postgres (/etc/init.d/postgresql restart) 并访问网
我想构建 postgres docker 容器来测试一些问题。我有: postgres 文件的归档文件夹(/var/lib/postgres/data/) 将文件夹放入 docker postgres
我有一个名为“stuff”的表,其中有一个名为“tags”的 json 列,用于存储标签列表,还有一个名为“id”的列,它是表中每一行的主键。我正在使用 postgres 数据库。例如,一行看起来像这
我对 sqlalchemy-psql 中的锁定机制是如何工作的感到非常困惑。我正在运行一个带有 sqlalchemy 和 postgres 的 python-flask 应用程序。由于我有多个线程处理
我(必须)使用 Postgres 8.4 数据库。在这个数据库中,我创建了一个函数: CREATE OR REPLACE FUNCTION counter (mindate timestamptz,m
我已经使用 PostgreSQL 几天了,它运行良好。我一直在通过默认的 postgres 数据库用户和另一个具有权限的用户使用它。 今天中午(在一切正常之后)它停止工作,我再也无法回到数据库中。我会
我是一名优秀的程序员,十分优秀!