python-3.x - 在不同进程之间共享内存中的复杂 python 对象-6ren

python-3.x - 在不同进程之间共享内存中的复杂 python 对象

转载作者：行者123 更新时间：2023-12-03 10:03:23

25

4

我有一个复杂的 python 对象，内存大小约为 36GB，我想在多个单独的 python 进程之间共享。它作为 pickle 文件存储在磁盘上，我目前为每个进程单独加载。我想共享这个对象，以便在可用内存量下并行执行更多进程。

从某种意义上说，此对象用作只读数据库。每个进程每秒发起多个访问请求，每个请求只是针对一小部分数据。

我研究了 Radis 之类的解决方案，但我发现最终需要将数据序列化为简单的文本形式。此外，将 pickle 文件本身映射到内存应该无济于事，因为每个进程都需要提取它。所以我想到了另外两种可能的解决方案:

使用共享内存，其中每个进程都可以访问存储对象的地址。这里的问题是进程只会看到大量字节，无法解释

通过 API 调用编写保存此对象并管理数据检索的代码。在这里，我想知道这种解决方案在速度方面的性能。

有没有一种简单的方法来实现这些解决方案中的任何一个？对于这种情况，也许有更好的解决方案？

非常感谢!

最佳答案

对于复杂的对象，没有现成的方法可以在进程之间直接共享内存。如果您有简单的 ctypes，您可以在 c 风格的共享内存中执行此操作，但它不会直接映射到 python 对象。

如果您在任何时候只需要一部分数据，而不是整个 36GB，那么有一个简单的解决方案可以很好地工作。为此，您可以使用 SyncManager 中的 multiprocessing.managers 。使用它，您可以设置一个服务器，为您的数据提供代理类(您的数据不存储在类中，代理只提供对它的访问)。然后您的客户端使用 BaseManager 连接到服务器并调用代理类中的方法来检索数据。

在幕后，Manager 类负责对您要求的数据进行 pickle ，并通过开放端口将其从服务器发送到客户端。因为您每次调用都在 pickle 数据，所以如果您需要整个数据集，这效率不高。在客户端只需要一小部分数据的情况下，该方法节省了大量时间，因为数据只需要服务器加载一次。

该解决方案在速度方面可与数据库解决方案相媲美，但如果您更愿意保持纯粹的 Pythonic 解决方案，它可以为您节省大量复杂性和 DB-learning。

下面是一些用于处理 GloVe 词向量的示例代码。

服务器

#!/usr/bin/python
import  sys
from    multiprocessing.managers import SyncManager
import  numpy

# Global for storing the data to be served
gVectors = {}

# Proxy class to be shared with different processes
# Don't but the big vector data in here since that will force it to 
# be piped to the other process when instantiated there, instead just
# return the global vector data, from this process, when requested.
class GloVeProxy(object):
    def __init__(self):
        pass

    def getNVectors(self):
        global gVectors
        return len(gVectors)

    def getEmpty(self):
        global gVectors
        return numpy.zeros_like(gVectors.values()[0])

    def getVector(self, word, default=None):
        global gVectors
        return gVectors.get(word, default)

# Class to encapsulate the server functionality
class GloVeServer(object):
    def __init__(self, port, fname):
        self.port = port
        self.load(fname)

    # Load the vectors into gVectors (global)
    @staticmethod
    def load(filename):
        global gVectors
        f = open(filename, 'r')
        for line in f:
            vals = line.rstrip().split(' ')
            gVectors[vals[0]] = numpy.array(vals[1:]).astype('float32')

    # Run the server
    def run(self):
        class myManager(SyncManager): pass  
        myManager.register('GloVeProxy', GloVeProxy)
        mgr = myManager(address=('', self.port), authkey='GloVeProxy01')
        server = mgr.get_server()
        server.serve_forever()

if __name__ == '__main__':
    port  = 5010
    fname = '/mnt/raid/Data/Misc/GloVe/WikiGiga/glove.6B.50d.txt'

    print 'Loading vector data'
    gs = GloVeServer(port, fname)

    print 'Serving data. Press <ctrl>-c to stop.'
    gs.run()

客户端

from   multiprocessing.managers import BaseManager
import psutil   #3rd party module for process info (not strictly required)

# Grab the shared proxy class.  All methods in that class will be availble here
class GloVeClient(object):
    def __init__(self, port):
        assert self._checkForProcess('GloVeServer.py'), 'Must have GloVeServer running'
        class myManager(BaseManager): pass
        myManager.register('GloVeProxy')
        self.mgr = myManager(address=('localhost', port), authkey='GloVeProxy01')
        self.mgr.connect()
        self.glove = self.mgr.GloVeProxy()

    # Return the instance of the proxy class
    @staticmethod
    def getGloVe(port):
        return GloVeClient(port).glove

    # Verify the server is running
    @staticmethod
    def _checkForProcess(name):
        for proc in psutil.process_iter():
            if proc.name() == name:
                return True
        return False

if __name__ == '__main__':
    port = 5010
    glove = GloVeClient.getGloVe(port)

    for word in ['test', 'cat', '123456']:
        print('%s = %s' % (word, glove.getVector(word)))

请注意， psutil 库仅用于检查服务器是否正在运行，不是必需的。确保将服务器命名为 GloVeServer.py 或通过代码中的 psutil 更改检查，以便它寻找正确的名称。

关于python-3.x - 在不同进程之间共享内存中的复杂 python 对象，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/47837206/

25

4

0

文章推荐： Mac 上的 .NET 开发技巧

文章推荐： screen-scraping - 如何录制屏幕并保存为gif动画？

文章推荐： SharePoint 搜索未索引文档库的内容

sql - 连续行之间的日期差异 - 复杂
我之前发布过question已得到答复，但我也需要对此进行查询。我有一个包含这样数据的表结构(日期格式为 dd/mm/yyyy)。 ID Account Number Unit Ad
javascript - 将对象数组转换为包含对象数组的对象(复杂)
我正在使用 React Native Calendars 并尝试为议程组件构建我的数据。预期的数据结构是(一个对象) { '2012-05-22': [{text: 'item 1 - any j
c - 复杂 while 语句的时间和空间复杂度
这个问题不太可能对任何 future 的访客有帮助；它只与一个较小的地理区域、一个特定的时间点或一个非常狭窄的情况相关，通常不适用于全世界的互联网受众。如需帮助使此问题更广泛适用，visit the
Mysql，复杂 ORDER BY
两列城镇和优先级。我需要对表进行排序，以便优先级=1的城镇排在第一位，并且不按名称 ASC 排序，而其余城镇则按名称 ASC 排序。我该怎么做？谢谢;) 更新 SELECT * FROM map
Mysql 复杂 SELECT
我有三个表“Hardware_model”、“Warehouse”和“Brand”，并且表以这种方式一起引用:Hardware_model 仓库Hardware_model 品牌现在我要执行以下
MySQL 复杂 SELECT
我有一个 MySQL 表 (tbl_filters)，包含 3 列:id、cat、val id 和 val 是数字，cat 是 varchar。每个 id 有多行。我还有另一个包含多个列的表 (tb
mysql 条件查询 - 复杂
我想获取字段的不同值，比方说:field1...这需要一个如下查询:“从表中选择不同的(字段1)” 但是，对于某些记录，field1 为空，并且还有另一列可以替代 field1，即 field2。对于
php - 修改MYSQL字段中的一个值有多个值(复杂)
表 1 - 用户 id username items 1 Paul 1(0020);2(0001); 表 2 - 项目 id name 1 name_here 在我的用户的项目中，我输入了 2(000
MySQL join同表按列显示行(复杂)
我想连接同一个表 4 次以获取列的显示方式，我不确定是否可以在 1 个 SQL 语句中完成。 tbl_用户名 id username 1 Adam 2 Bob 3 Chris tbl_机
javascript - 我该如何使其更加“复杂”？
首先，我刚刚开始自己学习JS，没有任何编程经验，这意味着我仍然要了解这种出色的编程语言的基本构建模块。我的问题与我编写的以下代码有关： let orderCount = 0; con
PHP - 从数据库中获取信息(复杂)
关闭。这个问题需要details or clarity .它目前不接受答案。想改进这个问题吗？通过 editing this post 添加细节并澄清问题. 关闭 9 年前。 Improve t
PHP + MySQL 复杂
我正在使用 XMAPP，MySQL 正在正常运行。在 phpMyAdmin 中，我不太明白这一点，所以我尝试在 PHP 中创建一个。使用此代码，它会告诉我数据库 benutzer。尽管我在 phpMy
algorithm - 寻找具有最大平均度数的子图。复杂？
是否有一种高效的算法可以找到平均度最大的子图(可能是图本身)？最佳答案 The paper "Finding a Maximum-Density Subgraph" by Andrew Goldbe
复杂「场景」数据导入导出
目录 1、业务背景 2、场景分析 3、流程设计 1、业务流程 2、导入流程
sql - 复杂(？)SQL 连接查询
我有 2 个表: 1) 包含自 1900 年 1 月 1 日以来所有日期的 Masterdates 表 2) Stockdata 表，其中包含表单中的股票数据日期、交易品种、开盘价、最高价、最低价、
.net - 复杂 UI 上的批量更新
我有一个非常复杂的 UI，其状态栏不断变化，其中包含多种类型的状态消息，并且 UI 具有复杂的图表控件和已加载的指示性地理 map 。现在这些小而复杂的区域的数据上下文具有同样复杂的 ViewMod
big-o - 复杂。为什么常量不重要？
有人可以用简单的方式向我解释为什么常量在大 O 表示法中无关紧要吗？为什么添加常量时复杂性保持不变。这不是作业问题，我只是想更好地理解这一点。让我明白这个大 O 是为了看到一个函数在接近无穷大时的行为
elasticsearch - 复杂 Elasticsearch 查询
我在 flex 搜索索引中有以下文档。 [{ "_index": "ten2", "_type": "documents", "_id": "c323c
LINQ - 如何保持(复杂)结果有序？
我有一个以零碎的方式构建的 LINQ 查询，如下所示: var initialQuery = from item in MyContext where xxx == yyy select item;
java - Hibernate 查询 - 复杂
我目前正在涉足 SQL，并且希望针对我所创建的问题获得一些帮助。为了练习一些编程，我正在制作一个 IOU 应用程序。下面是我存储的表我的借条记录(忽略一些相关栏目)。该表允许用户说“嘿，你欠我 X

首页

博学

6Ren·AI

商城

python-3.x - 在不同进程之间共享内存中的复杂 python 对象