python - Django + Postgres +大时间系列-6ren

python - Django + Postgres +大时间系列

转载作者：太空狗更新时间：2023-10-29 18:14:27

25

4

我正在确定一个包含大型，几乎不可压缩的时间序列数据的项目，并想知道带有原始SQL的Django + Postgres是否合适。

我有每小时约2000个对象/小时的时间序列数据。我每年要存储大约200万行，我想1)能够通过连接分割数据以进行分析，2)能够在Django的服务下进行基本的网络概述工作。我认为最好的主意是将Django用于对象本身，但直接使用原始SQL来处理关联的大型时间序列数据。我认为这是一种混合方法。这可能是一个危险信号，但是对一连串的数据样本使用完整的ORM感觉有些过头了。有没有更好的办法？

最佳答案

如果我正确理解您的想法，那么您正在考虑将时间序列存储在PostgreSQL中，一个时间序列记录存储在一个数据库行中。不要那样做
一方面，这个问题是理论上的。关系数据库(我认为大多数数据库)是基于行独立性的前提，而时间序列的记录是按物理顺序排列的。当然，数据库索引为数据库表提供了一些顺序，但是该顺序是为了加快搜索速度或按字母顺序或其他顺序显示结果。它并不意味着该顺序有任何自然的含义。不管您如何订购它们，每个客户都独立于其他客户，并且每个客户的购买都独立于他的其他购买，即使您可以按时间顺序将它们完全合并以形成客户的购买历史。时间序列记录的相互依赖性要强得多，这使得关系数据库不合适。
实际上，这意味着表及其索引占用的磁盘空间将很大(可能比将时间序列存储在文件中大20倍)，并且从数据库中读取时间序列将非常慢，类似于命令比存储在文件中慢得多。它也不会给您任何重要的好处。您可能永远不会进行查询“给我所有值大于X的时间序列记录”。如果您需要这样的查询，则还需要进行其他分析，而关系数据库尚未设计成执行该分析，因此无论如何您都将整个时间序列读入某个对象。
因此，每个时间序列都应存储为文件。它可能是文件系统上的文件，也可能是数据库中的Blob。尽管我拥有implemented the latter，但我相信前者更好。在Django中，我会这样写:

class Timeseries(models.model):
    name = models.CharField(max_length=50)
    time_step = models.ForeignKey(...)
    other_metadata = models.Whatever(...)
    data = models.FileField(...)

使用 FileField将使您的数据库更小，并使创建系统的增量备份更加容易。通过在文件中查找来获取 slice 也将变得更加容易，这对于blob来说可能是不可能或很难的。
现在，什么样的文件？我建议你看看 Pandas 。这是一个用于数学分析的python库，它支持时间序列，并且还应该有一种在文件中存储时间序列的方法。
我在上面链接到我的图书馆，我不建议您使用它。一方面，它不能满足您的要求(它不能处理超过一分钟的粒度，并且还有其他缺点)，另一方面，它已经过时了-我在 Pandas 之前写了它，打算转换它将来用 Pandas Pandas 的作者写了一本书“Python for data analysis”，我发现它是无价的。
更新(2016):还有InfluxDB。从未使用过它，因此我没有意见，但是如果您想知道如何存储时间序列，那绝对是您需要检查的东西。
更新(2020-02-07):还有 TimescaleDB，它是PostgreSQL的扩展。
更新(2020-08-07):我们再次更改了软件，以使其使用 TimescaleDB将数据存储在数据库中。我们已经精通PostgreSQL，并且很容易学习一些TimescaleDB。最重要的具体优势是，我们可以进行查询，例如“在2019年的24小时内查找所有降雨量大于50mm的位置”，这在将数据存储在平面文件中时非常困难。另一个优势是完整性检查-多年来，由于这里和那里的小错误，我们有一些时间序列重复行。缺点也很明显。它使用10倍以上的磁盘空间。因此，我们可能需要更改PostgreSQL备份策略。慢一点检索30万条记录的时间序列可能需要一秒钟的时间。这是瞬间。我们需要实现缓存以检索时间序列，而这在以前是不需要的。

关于python - Django + Postgres +大时间系列，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/25212009/

25

4

0

文章推荐： Firebase:INVALID_TOKEN:无法验证 MAC

文章推荐： c# - 如何处理来自 BackgroundWorker 线程的异常？

文章推荐： angular - 使用 Http JSON AngularJS 2 时出错

文章推荐： c# - 在 C# 中的邮件正文中附加图像

postgres-xl - 在单机配置上设置 Postgres-XL
我想知道这里是否有人有安装 Postgres-XL 的经验，新的开源多线程版本的 PostgreSQL。我计划将一组 1-2 TB 的数据库从常规 Postgres 9.3 迁移到 XL，并且想知道这
postgresql - postgres 备份脚本不是 postgres 用户
我想创建一个 postgres 备份脚本，但我不想使用 postgres 用户，因为我所在的 unix 系统几乎没有限制。我想要做的是在 crontab 上以 unix 系统(网络)的普通用户身份运行
node-postgres - 在 node-postgres 中使用字符串文字进行参数化查询
我正在尝试编写一个 node-postgres 查询，它采用一个整数作为参数在间隔中使用: const query = { text: `SELECT foo
postgresql - 如何从命令行停止 (postgres.app) postgres 集群
如何在不使用 gui 的情况下停止特定的 Postgres.app 集群。我想使用 bash/Terminal.app 而不是 gui 我还应该指出，Postgres 应用程序有一个这样的菜单如果
security - 在 POSTGRES 数据库中为 'postgres' 用户添加密码是个好主意吗？
关闭。这个问题是opinion-based .它目前不接受答案。想要改进这个问题？更新问题，以便 editing this post 可以用事实和引用来回答它. 关闭 9 年前。 Improve
postgresql - Postgres docker "User "postgres“没有分配密码。”
我正在使用 docker 运行 Postgres 图像。它曾经在 Windows10 和 Ubuntu 18.04 上运行没有任何问题。在 Ubuntu 系统上重新克隆项目后，它在运行 docker
python - 从另一个 postgres 表更新一个 postgres 表
我正在使用 python(比如表 A)将批处理 csv 文件加载到 postgres。我正在使用 pandas 将数据上传到更快的 block 中。 for chunk in pd.read_csv(
postgresql - 在源 Postgres 服务器离线时迁移 Postgres DB
所以是的，标题说明了一切，我需要以某种方式将 DB 从源服务器获取到新服务器，但更重要的是旧服务器正在崩溃 :P 有什么方法可以将它全部移动到新服务器并导入它？旧服务器只是拒绝再运行 Postgre
postgresql - Postgres systemd 单元文件如何确定要运行的 Postgres 版本？
这主要是出于好奇而提出的问题。我正在浏览 Postgres systemd 单元文件，以了解 systemd 可以做什么。 Postgres 有两个 systemd 单元文件。一个用于代替 syste
postgresql - 为什么 Postgres 不要求用户 postgres 的密码？
从我在 pg_hba.conf 中读到的内容，我推断，为了确保提示我输入 postgres 用户的密码，我应该从当前的“对等”编辑 pg_hba.conf 的前两个条目的方法'到'密码'或'md5'，
sql - Postgres : user mapping not found for "postgres"
我已连接到架构 apm。尝试执行函数并出现以下错误: ERROR: user mapping not found for "postgres" 数据库连接信息说: apm on postgres@
postgresql - 无法创建用户 postgres : role "postgres" does not exists
我在 ubuntu 12.04 服务器上，我正在尝试安装 postgresql。截至目前，我已成功安装它但无法配置它。我需要创建一个角色才能继续前进，我在终端中运行了这个命令: root@hostna
database - 无法以 'postgres' 用户身份登录到 'postgres' 数据库
我无法以“postgres”用户身份登录到“postgres”数据库。操作系统:REHL 服务器版本 6.3PostgreSQL 版本:8.4有一个数据库“jiradb”用作 JIRA 6.0.8 的
postgresql - 在 docker postgres 容器中导入 postgres 数据库
我正在尝试将现有数据库导入 postgres docker 容器。这就是我的处理方式: docker run --name pg-docker -e POSTGRES_PASSWORD=*****
postgresql - 重新启动 postgres 后使用 Grails 自动重新连接到 postgres
我们的 Web 应用程序在 postgres 9.3 和 Grails 2.5.3 上运行。当我们重新启动 postgres (/etc/init.d/postgresql restart) 并访问网
postgresql - 如何将现有的 postgres 数据文件夹复制和使用到 docker postgres 容器中
我想构建 postgres docker 容器来测试一些问题。我有: postgres 文件的归档文件夹(/var/lib/postgres/data/) 将文件夹放入 docker postgres
postgresql - 如何将 postgres json 列表转换为全小写的 postgres 数组
我有一个名为“stuff”的表，其中有一个名为“tags”的 json 列，用于存储标签列表，还有一个名为“id”的列，它是表中每一行的主键。我正在使用 postgres 数据库。例如，一行看起来像这
python - postgres 中的锁定机制/postgres 中的死锁。 [我正在使用 sqlalchemy]
我对 sqlalchemy-psql 中的锁定机制是如何工作的感到非常困惑。我正在运行一个带有 sqlalchemy 和 postgres 的 python-flask 应用程序。由于我有多个线程处理
sql - Postgres 函数比查询/Postgres 8.4 慢
我(必须)使用 Postgres 8.4 数据库。在这个数据库中，我创建了一个函数: CREATE OR REPLACE FUNCTION counter (mindate timestamptz,m
linux - Postgres : psql: FATAL: role "postgres" does not exist
我已经使用 PostgreSQL 几天了，它运行良好。我一直在通过默认的 postgres 数据库用户和另一个具有权限的用户使用它。今天中午(在一切正常之后)它停止工作，我再也无法回到数据库中。我会

首页

博学

6Ren·AI

商城

python - Django + Postgres +大时间系列