Python 多进程共享内存与使用参数-6ren

Python 多进程共享内存与使用参数

转载作者：行者123 更新时间：2023-12-04 22:45:30

32

4

我试图弄清楚什么是在不同进程之间共享相同数据源的最有效且内存消耗更少的方式。

想象一下以下代码，它简化了我的问题。

import pandas as pd
import numpy as np
from multiprocessing import Pool

# method #1
def foo(i): return data[i]
if __name__ == '__main__':
    data = pd.Series(np.array(range(100000)))
    pool = Pool(2)
    print pool.map(foo,[10,134,8,1])

# method #2
def foo((data,i)): return data[i]
if __name__ == '__main__':
    data = pd.Series(np.array(range(100000)))
    pool = Pool(2)
    print pool.map(foo,[(data,10),(data,134),(data,8),(data,1)])

在第一种方法中，将使用全局变量(不适用于 Windows，仅适用于 Linux/OSX)，然后由函数访问。在第二种方法中，我将“数据”作为参数的一部分传递。

在进程使用的内存方面，这两种方法会有区别吗？

# method #3
def foo((data,i)): return data[i]
if __name__ == '__main__':
    data = pd.Series(np.array(range(100000)))
    pool = Pool(2)
    # reduce the size of the argument passed
    data1 = data[:1000]
    print pool.map(foo,[(data1,10),(data1,134),(data1,8),(data1,1)])

第三种方法，而不是传递所有“数据”，因为 我们知道 我们将只使用第一条记录，我只传递前 1000 条记录。这会有什么不同吗？

背景
我面临的问题是我有一个大约 200 万行(内存为 4GB)的大数据集，然后将通过四个子进程进行一些阐述。每个细化只影响一小部分数据(20000 行)，我想尽量减少每个并发进程的内存使用。

最佳答案

我将从第二种和第三种方法开始，因为它们更容易解释。

当您将参数传递给 pool.map 时或 pool.apply ，参数将被pickle，使用管道发送到子进程，然后在子进程中unpickled。这当然需要您传递的数据结构的两个完全不同的副本。它还可能导致大型数据结构的性能下降，因为酸洗/取消酸洗大对象可能需要很长时间。

使用第三种方法，您只是传递比方法二更小的数据结构。这应该表现更好，因为您不需要腌制/取消腌制尽可能多的数据。

另一张纸条 - 路过 data多次绝对是一个坏主意，因为每个副本都会被反复腌制/取消腌制。你想把它传递给每个 child 一次。方法 1 是一个很好的方法，或者您可以使用 initializer显式传递的关键字参数 data给 child 。这将使用 fork在 Linux 上和在 Windows 上进行酸洗以将数据传递给子进程:

import pandas as pd
import numpy as np
from multiprocessing import Pool

data = None

def init(_data):
    global data
    data = _data  # data is now accessible in all children, even on Windows

# method #1
def foo(i): return data[i]
if __name__ == '__main__':
    data = pd.Series(np.array(range(100000)))
    pool = Pool(2, initializer=init, initargs=(data,))
    print pool.map(foo,[10,134,8,1])

使用第一种方法，您正在利用 fork 的行为允许子进程继承 data目的。 fork具有 copy-on-write 语义，这意味着内存实际上在父级和它的子级之间共享，直到您尝试在子级中写入它。当您尝试写入时，您尝试写入的数据所在的内存页面必须被复制，以使其与父版本分开。

现在，这听起来像是灌篮——只要我们不写任何东西就不需要复制任何东西，这肯定比 pickle/unpickle 方法快。通常情况就是这样。然而，实际上，Python 在内部写入其对象，即使您并不真正期望它这样做。由于 Python 使用引用计数进行内存管理，因此每次将对象传递给方法或分配给变量等时，它都需要增加每个对象的内部引用计数器。因此，这意味着包含每个传递对象的引用计数的内存页到您的子进程最终将被复制。这肯定会比酸洗更快并且使用更少的内存 data多次，但也不是完全共享。

关于Python 多进程共享内存与使用参数，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/28862115/

32

4

0

文章推荐： string - VB 脚本日期格式 "YYYYMMDDHHMMSS"

文章推荐： python - 用python将视频分成帧

文章推荐： ffmpeg - 如何删除 ffmpeg 元数据 "software lavf55.7.100"

文章推荐： julia - 无法安装 julia 包

linux - 如何通过 STIME 终止 linux 进程(悬空 svnserve 进程)
我是 Linux 的新手，并且继承了保持我们的单一 Linux 服务器运行的职责。这是我们的SVN服务器，所以比较重要。原来在我之前维护它的人有一个 cron 任务，当有太多 svnserve 进程
Nodejs极简入门教程（三）：进程
Node 虽然自身存在多个线程，但是运行在 v8 上的 JavaScript 是单线程的。Node 的 child_process 模块用于创建子进程，我们可以通过子进程充分利用 CPU。范例：
ubuntu - Jenkins 进程
Jenkins 有这么多进程处于事件状态是否正常？我检查了我的设置，我只配置了 2 个“执行者”... htop http://d.pr/i/RZzG+ 最佳答案您不仅要限制 Master 中的执
带管道的 Scala 进程
我正在尝试在 scala 中运行这样的 bash 命令: cat "example file.txt" | grep abc Scala 有一个特殊的流程管道语法，所以这是我的第一个方法: val f
循环和文件输出中的 Java 进程
很难说出这里要问什么。这个问题模棱两可、含糊不清、不完整、过于宽泛或夸夸其谈，无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开，visit the help center . 关闭 1
multithreading - 进程、线程和并发编程
我需要一些帮助来理解并发编程的基础知识。事实上，我读得越多，就越感到困惑。因此，我理解进程是顺序执行的程序的一个实例，并且它可以由一个或多个线程组成。在单核CPU中，一次只能执行一个线程，而在多核CP
testing - 在集成测试期间如何运行服务器(进程)？
我的问题是在上一次集成测试后服务器进程没有关闭。在integration.rs中，我有: lazy_static! { static ref SERVER: Arc> = {
Scala 进程 - 捕获标准输出和退出代码
我正在使用 Scala scala.sys.process图书馆。我知道我可以用 ! 捕获退出代码和输出 !!但是如果我想同时捕获两者呢？我看过这个答案 https://stackoverflow
c++ - 使用共享库同步两个C++进程
我正在开发一个C++类(MyClass.cpp)，将其编译为动态共享库(MyClass.so)。同一台Linux计算机上运行的两个不同应用程序将使用此共享库。它们是两个不同的应用程序。它不是多线程
c - 查找UDP数据包的源IP/进程
我在我的 C 程序中使用 recvfrom() 从多个客户端接收 UDP 数据包，这些客户端可以使用自定义用户名登录。一旦他们登录，我希望他们的用户名与唯一的客户端进程配对，这样服务器就可以通过数据包
C、进程、fork
如何更改程序，以便函数 function_delayed_1 和 function_delayed_2 仅同时执行一次: int main(int argc, char *argv[]) {
c - 操作系统 - 进程
考虑这两个程序: //in #define MAX 50 int main(int argc, char* argv[]) { int *count; int fd=shm
linux - 如何同时打开三个终端(进程)
请告诉我如何一次打开三个终端，这样我的项目就可以轻松执行，而不必打开三个终端三次然后运行三个exe文件。请问我们如何通过脚本来做到这一点，即打开三个终端并执行三个 exe 文件。最佳答案在后台运行
远程计算机上的 C# 进程
我编写了一个监控服务来跟踪一组进程，并在服务行为异常、内存使用率高、超出 CPU 运行时间等时发出通知。这在我的本地计算机上运行良好，但我需要它指向远程机器并获取这些机器上的进程信息。我的方法，在
c# - 进程、线程和线程池
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。想改进这个问题？将问题更新为 on-topic对于堆栈溢出。 8年前关闭。 Improve this qu
c# - 后台线程/进程
我有一个允许用户上传文件的应用程序。上传完成后，必须在服务器上完成许多处理步骤(解压、存储、验证等...)，因此稍后会在一切完成后通过电子邮件通知用户。我见过很多示例，其中 System.Compo
linux - 什么时候将虚拟地址分配给程序/进程？
这个问题对很多人来说可能听起来很愚蠢，但我想对这个话题有一个清晰的理解。例如:当我们在 linux(ubuntu, x86) 上构建一个 C 程序时，它会在成功编译和链接过程后生成 a.out。 a.
java - 在linux中如何识别一个进程是java还是c或c++进程？
ps -eaf | grep java 命令在这里不是识别进程是否是 java 进程的解决方案，因为执行此命令后我的许多 java 进程未在输出中列出。最佳答案简答(希望有人写一个更全面的): 获
内核与系统中的 Windows 进程
我有几个与内核态和用户态的 Windows 进程相关的问题。如果我有一个 hello world 应用程序和一个暴露新系统调用 foo() 的 hello world 驱动程序，我很好奇在内核模式下
具有不受信任完整性级别的 Windows 进程
我找不到很多关于 Windows 中不受信任的完整性级别的信息，对此有一些疑问: 是否有不受信任的完整性级别进程可以创建命名对象的地方？ (互斥锁、事件等) 不受信任的完整性级别进程是否应该能够打开一

首页

博学

6Ren·AI

商城

Python 多进程共享内存与使用参数