python - 如何并行处理数据库中的: 6 machines, 800万个独立文档-6ren

python - 如何并行处理数据库中的: 6 machines, 800万个独立文档

转载作者：行者123 更新时间：2023-11-30 00:08:43

24

4

背景:

我的数据库中有 800 万个独立文档需要处理。这些文档彼此不依赖，这意味着该过程可以并行化。处理完一份文档后，将结果保存回数据库。

有 6 台机器供我使用。

当前解决方案

文档使用 MySQL 中的一张表存储。

我现在将行平均分为 6 份，每份供一台机器处理。

当前解决方案的缺点

某些分区可能需要更长的时间来处理，从而导致一些机器在其他机器空闲时忙碌。

要求

我想找到一种方法/框架来有效地平衡任务负载
我使用 Python 作为数据处理工具，因此希望有适合 Python 的工具。

最佳答案

您应该向文档表添加一个进度字段，而不是将行划分为相等的份额(您实际上应该创建一个进度表并执行外连接，但您会明白这个想法)。然后，在每个工作人员中，您首先预订一组文档(假设 id 是主键，WORKERID 是每个工作人员的唯一 ID):

update documents set progress = WORKERID
where progress is null
limit 1000

(如果您使用旧版本的 MySQL，您可能需要更复杂的语法: update multiple rows using limit in mysql? )

确保您的限制足够大，以便您的数据库有一些喘息空间，但又不能大到您必须等待最后一个工作人员完成他的第 10000 个文档:-)

然后你可以开始迭代:

c.execute("select * from documents where progress = %s", my_worker_id)
for doc in c.fetchall():
    # process doc..
    c.execute("update documents set progress = 'done' where id = %s", doc.id)
    cn.commit()

这具有非常容易实现、非常快的优点，并且使您能够重新启动任何工作器等。

如果你只有 6 个工作线程，我会手动启动它们。

哦，您可以使用简单的 sql 语句手动关注进度:

select progress, count(*)
from documents
group by progress
order by progress

这将为您提供剩余的数量(progress = null)、已完成的数量(progress = 'done')以及每个工作队列中有多少数量(progress = WORKERID)。

关于python - 如何并行处理数据库中的: 6 machines, 800万个独立文档，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/24279528/

24

4

0

文章推荐：来自数据库的 PHP OOP 变量

文章推荐： php - UTF-8贯穿始终

文章推荐： PHP/MySQL。无法更新数据: Query was empty

文章推荐： mysql - 从时间戳列中选择最近几个月的记录 mysql

独立；获取方法的参数
我如何使用 CQLINQ 获取当前方法的输入参数集合？有像“参数”或“参数”这样的集合，只有“NbParamenter”不适合我的目的。最佳答案事实上，CQLinq 还没有这个功能。但是，在许多情
makefile 独立@符号和目录关键字
我想知道是否有人知道我的 makefile 中独立的 @ 符号和“dir”命令在这里(第二行和第三行)的作用: $(BUILD)/%.o: %.cpp @mkdir -p $(dir $@)
makefile 独立@符号和目录关键字
我想知道是否有人知道我的 makefile 中独立的 @ 符号和“dir”命令在这里(第二行和第三行)的作用: $(BUILD)/%.o: %.cpp @mkdir -p $(dir $@)
java - Spark 独立
我的机器上有带有 4 个 cpu 的 Ubuntu 14.04(nproc 恢复了 4 个)。我安装并执行 Spark Standalone 后(本地)，我可以自己定义不同数量的奴隶。例如我想要有4个
C# 独立 WebDAV
我看到所有这些 iPhone 应用程序都带有内置的独立 webDav 服务器。是否有可以集成到现有应用程序中的独立(如在其自己的 IIS 中)C# webDAV 项目。最佳答案至少有两个用于 .N
django - 独立 Django 应用程序中的迁移
我如何在独立的 Django 应用程序上进行迁移(即不属于任何项目的应用程序)。例如在以下之后:https://docs.djangoproject.com/en/1.8/intro/reusabl
svn - 独立 SVN 查看器
我目前正在使用 tortoiseSVN 对本地编程文件进行版本控制。我不运行 SVN 服务器，因为可以直接使用 tortoiseSVN(例如 http://invalidlogic.com/2006/
javascript - 如何在Bootstrap中为*独立*几个进度条部分设置动画？
我有一些 Bootstrap 代码，当用户查看它时，它可以很好地为进度条部分设置动画。然而它动画全部页面中的进度条而不是动画仅限该查看部分中的进度条。结果，当用户转到进度条的另一部分时，这些已
iOS 独立 PWA 输入捕获
我认为我们在 iOS 13.2/13.3 中发现了关于在独立模式下运行的 PWA 的回归。由于在 iOS PWA 上无法访问 getUserMedia() 我们依赖 capture HTML5 输入
excel - 独立 Excel 宏
我有一个每周从系统运行一次的报告，并将数据导出到 Excel 文档中。我已经设置了将数据导出到 Excel 的工具，以便在格式化方面做得很好，但是一旦数据进入 Excel，我还需要做更多的事情。是否
java - 独立(并行)替换字符串中的一组子字符串
//值数组的格式为 { "var1", "val1", "var2", "val2",.. } public static String replaceMethod(String template,
java - 独立 jar 滞后
当我在 eclipse 中运行我的项目时，它工作正常，当我将它导出为独立 jar 时，它会滞后。我使用相同的 vmargs，在 Eclipse 中尝试了 3 种不同的导出设置，似乎没有任何帮助最佳答
java - 独立 Java 程序中的注释基础配置
我了解到 Java EE 中我非常喜欢的注释基础配置(@Resource)功能。然后我注意到注释实际上是 Java SE 的一部分。所以我想知道是否可以将它与 Java SE 一起使用。我当然可以在
java - jpa + hibernate + 独立
我无法理解为什么这种关系没有被持久化，并且程序不会正常退出，但在 Eclipse 中继续运行。下面是我的代码，排除了包名: 主要: import java.io.BufferedInputStrea
java - 独立 java 应用程序的线程转储
我有一个在 Linux + Java 6 上运行的独立 Java 应用程序，它似乎被卡住了(没有生成日志)我如何在不使用任何其他工具(例如 jstack)的情况下获取此线程转储尝试了以下命令，但它们
javascript - 独立 Babel 和使用箭头函数插件？
我正在非节点环境中构建应用程序，但我想利用 Babel 的 ES6 转译，以便我可以编写更好的代码并且仍然支持 IE11。所以我继续包含在这里找到的独立文件: https://github.com/
MySQL 64 位？独立？
扩展我对 MySQL 的理解。 1) 是否需要 64 位帮助？我是安装还是单独使用？ 2) 如果我打算在 MySQL Community Service 中使用 64 位，它会影响仅提供 32 位的
java - 独立 Java 应用程序的规则引擎
我有一个独立的 Java 应用程序，我必须为其集成一个规则引擎。我应该使用属性文件或 XML 文件定义规则。我需要规则引擎来读取属性或 XML 文件中定义的这些规则，并相应地在应用程序中实现代码。任
java - 独立 Wiremock + 使用的端口
我是wiremock新手，我正在尝试使用它来记录我负责集成测试的java应用程序的请求和响应。我知道我的命令将类似于: java -jar wiremock-1.57-standalone.jar
android - 独立 RadioGroup 列表
我到处寻找我的问题的解决方案，但我的问题有点具体...我需要有关如何创建独立 radioGroup 列表的建议，例如图示: o item1 • item1' • item2 或 item2' o it

首页

博学

6Ren·AI

商城

python - 如何并行处理数据库中的: 6 machines, 800万个独立文档