database - SQLAlchemy、UUID、Sharding 和 AUTO_INCREMENT 主键……如何让它们协同工作？-6ren

database - SQLAlchemy、UUID、Sharding 和 AUTO_INCREMENT 主键……如何让它们协同工作？

转载作者：太空狗更新时间：2023-10-30 01:51:41

24

4

我有一个关于 SQLAlchemy、数据库分片和 UUID 的问题要问你们这些好人。

我目前正在使用 MySQL，其中有一个表格:

CREATE TABLE foo (
    added_id INT NOT NULL AUTO_INCREMENT PRIMARY KEY,
    id BINARY(16) NOT NULL,
    ... other stuff ...
    UNIQUE KEY(id)
);

这张 table 的一些背景。我从不关心'added_id'，我只是用来确保插入的项目在磁盘上聚集在一起(因为用于索引 MySQL 中的表的 B-Tree 使用主键作为集群索引)。 “id”列包含 UUID 的二进制表示形式——这是我真正关心的列，所有其他内容都引用此 ID。同样，我不希望 UUID 成为主键，因为 UUID 是随机的，因此创建用于索引表的 B-Tree 具有可怕的 IO 特性(至少其他地方是这么说的)。此外，尽管 UUID1 包含时间戳以确保按“顺序”顺序生成 ID，但在 ID 中包含 MAC 地址使它成为我宁愿避免的东西。因此，我想使用 UUID4。

好的，现在转到 SQLAlchemy 部分。在 SQLAlchemy 中，可以使用 ORM 为上表定义一个模型，方法如下:

# The SQL Alchemy ORM base class
Base = declerative_base()

# The model for table 'foo'
class Foo(Base):
    __table__ = 'foo'
    add_id = Column(Integer, primary_key=True, nullable=False)
    id = Column(Binary, index=True, unique=True, nullable=False)
    ...

同样，这与上面的 SQL 基本相同。

现在开始这个问题。假设这个数据库将被分片(水平分区)为 2 个(或更多)独立的数据库。现在，(假设没有删除)这些数据库中的每一个都将在表 foo 中具有 added_id 为 1、2、3 等的记录。由于 SQLAlchemy 使用 session 来管理正在处理的对象，以便每个对象仅由其主键标识，因此似乎有可能出现我可以结束尝试从两个 Foo 对象访问两个对象的情况具有相同 added_id 的分片会导致托管 session 中出现一些冲突。

有人遇到过这个问题吗？你做了什么来解决它？或者，更有可能的是，我是否遗漏了 SQLAlchemy 文档中的某些内容以确保不会发生这种情况。然而，查看 SQLAlchemy 下载提供的分片示例(examples/sharding/attribute_shard.py)，他们似乎通过将其中一个数据库分片指定为 ID 生成器来回避这个问题......创建一个隐式瓶颈作为所有INSERTS 必须针对该单个数据库才能获得 ID。 (他们还提到使用 UUID，但显然这会导致索引的性能问题。)

或者，有没有办法将 UUID 设置为主键，并使用 added_id 将数据聚集在磁盘上？如果在 MySQL 中不可行，是否可以在其他数据库(如 Postgres)中实现？

在此先感谢您的所有意见!

---更新----我只想添加一个我收到的关于这个问题的带外答案。下面的文字不是我写的，我只是想把它放在这里以防有人觉得它有用。

The easiest way to avoid that situation with MySQL and auto increment keys is to use different auto increment offsets for each database, e.g.:

ALTER TABLE foo AUTO_INCREMENT=100000;

The downside is that you need to take care in terms of how you configure each shard, and you need to plan a bit wrt the total number of shards you use.

There isn't any way to convince MySQL to use a non-primary key for the clustered index. If you don't care about using SQLAlchemy to manage your database schema (although, you probably should), you can simply set the UUID as the primary key in the SQLAlchemy schema and leave the add_id as the pk in the actual table.

I've also seen alternate solutions that simply use an external server (e.g. redis) to maintain the row id.

最佳答案

是的，您可以使用“primary_key”映射器参数将表的任何列指定为用于映射目的的主键，它是列对象的列表或单个列:

Base = declarative_base()

# The model for table 'foo'
class Foo(Base):
    __table__ = 'foo'
    add_id = Column(Integer, primary_key=True, nullable=False)
    id = Column(Binary, index=True, unique=True, nullable=False)

    __mapper_args__ = {'primary_key': id}

上面，虽然 SQLAlchemy Core 会将“add_id”视为“自动增量”列，但映射器对它基本上不感兴趣，而是在考虑对象的“身份”时使用“id”作为它关心的列.

参见 documentation for mapper()更多描述。

关于database - SQLAlchemy、UUID、Sharding 和 AUTO_INCREMENT 主键……如何让它们协同工作？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/13167799/

24

4

0

文章推荐： sql - 需要一种在 SQL 数据库中存储/查询 json 的有效方法

文章推荐： python django 模拟缓存

文章推荐： python - 尝试在一行 if 语句中使用 pass 关键字时出错

文章推荐： database - 替代 MS Access 中的多值字段

database - 主-主 vs 主-从数据库架构？
我听说过两种数据库架构。大师级主从 master-master不是更适合现在的web吗，因为它就像Git一样，每个单元都有整套数据，如果一个宕机也无所谓。主从让我想起了 SVN(我不喜欢它)，你
mysql 复制主-主-主
我们当前将 MySQL 配置为支持故障转移:Site1 Site2。当它们被设置为主/主时。在给定时间点，应用程序服务器仅主动写入一个站点。我们想要设置一个新的故障转移站点。然后我们将拥有 Site
database - 主-主 vs 主从数据库架构？
我听说过两种数据库架构。大师-大师主从 master-master 不是更适合当今的网络吗，因为它就像 Git，每个单元都有整套数据，如果其中一个发生故障，也没关系。主从让我想起 SVN(我不喜
MySQL:类别和子类别的交叉表引用(主、主、名称)？
我正在创建一个标记为类别的表，其中主类别(父列)包含 0，子类别包含父类别的 ID。我听说这叫引用。我的问题:这张表的结构正确吗？或者是否有更好的方法，例如实现遍历树或类似方法？ CREATE TAB
C++ 主 vs C 主
我正在阅读一份关于 C++ 与 C 的文档。该文档说与 C 相比，C++ 编写得非常紧凑。一个例子是，C 允许 main() 函数类型为 void。另一方面，C++ 不允许这样做，他给出了标准中的以下
java - C 主 vs Java 主
C main函数和Java main函数有什么区别？ int main( int argc, const char* argv[] ) 对比 public static void main(Strin
responsive-design - 3 列(左、主、右)站点，但较小的设备首先是主(主、左、右)
我一直摸不着头脑，但运气不好。设计器有一个包含 3 栏的站点、两个侧边栏和一个主要内容区域。专为桌面设计，左栏、主要内容、右栏。但是，在较小的设备上，我们希望首先堆叠主要内容。所以通常情况下，你可
Jenkins 主/从配置
我一直在阅读有关 Jenkins 主/从配置的信息，但我仍然有一些问题: 是不是真的没有像 Jenkins 主站那样安装和启动从站 Jenkins？我假设我会以相同的方式安装一个主 Jenkins 和
c# - 主/细节的通用Viewmodel模式
据我了解，Viemodel中MVVM背后的概念包括业务逻辑和/或诸如暴露于 View 的数据的主/明细关系之类的事物因此，正如我发现的那样，有很多ORM生成器，例如模型的telerik a.o以及另
elasticsearch - 主/副本计分不一致
我们有一个群集，其中包含3个主分区，每个主分区有2个副本。主/副本分片的总文档数相同；但是，对于同一查询/文档，我们得到3个不同的分数。当我们将preference = primary添加为查询参数时
java - 从指定目录启动Java应用程序(主)
我有一个非常大/旧/长时间运行的项目，它使用相对于启动目录的路径访问文件资源(即应用程序仅在从特定目录启动时才工作)。当我需要调试程序时，我可以从 eclipse 启动它并使用“运行配置”->->“工
c - 主/从设备出现段错误
谁能向我解释一下为什么我在这段代码上遇到段错误？我一直试图弄清楚这一点，但在各种搜索中却一无所获。当我运行代码而不调用 main(argc, argv) 时，它会运行。 Slave 仅将 argv 中
ios - 主 - 详细项目未按预期工作
使用 xcode 中的默认项目作为主从应用程序，如果我在折叠委托(delegate)中放置 print 调试语句，当我旋转设备时它似乎永远不会被触发(事实上我永远无法触发它)。我编辑的代码位于 Ap
mysql 主/从故障转移
是否有任何产品可以使 mysql 主/从故障转移过程更容易？一些可以自动发生的事情，而不是手动修复它。最佳答案 [...稍后...;) 你所说的“更容易”是什么？MySQL 有很多解决方案: MyS
MySQL 主/主复制仅以一种方式工作
我有两个 mysql 数据库。我想做主/主复制。复制以一种方式进行。然而，反过来说却不然。该错误表明它无法与用户“test@IPADDRESS”连接。如何将用户名更改为 repl？从未进行过测试，
MySQL 主-主复制
我正在尝试在 MySQL 中运行以下查询: GRANT REPLICATION SLAVE ON *.* TO 'replication'@’10.141.2.%’ IDENTIFIED BY ‘sl
android - 主/从流程中的操作栏菜单项
我正在尝试使用 Android 提供的主/详细流程模板创建一个应用程序，并且我正在尝试将多个操作栏菜单项添加到操作栏的主要部分和详细信息部分。这就是我要实现的目标: (来源:softwarecrew.
C++ 主/工
我正在寻找一个跨平台的 C++ master/worker 库或工作队列库。一般的想法是我的应用程序将创建某种任务或工作对象，将它们传递给工作主机或工作队列，这将依次在单独的线程或进程中执行工作。为了
MySQL 主/外键大小？
我似乎看到很多人在他们的 MySQL 模式中任意分配大尺寸的主/外键字段，例如 INT(11) 甚至 WordPress 使用的 BIGINT(20)。如果我错了，请纠正我，但即使是 INT(4)
sql - 主/外键与没有主键的单表的性能
如果我有一个可以与多个键相关联的用户，正确的表设置应该是: 一个表有两列，例如: UserName | Key 没有主键且用户可以有多行，或者: 具有匹配标识符的两个表 Table 1 Us

首页

博学

6Ren·AI

商城

database - SQLAlchemy、UUID、Sharding 和 AUTO_INCREMENT 主键……如何让它们协同工作？