python - 在 Python 中使用命名元组字典导致内存不足-6ren

python - 在 Python 中使用命名元组字典导致内存不足

转载作者：太空宇宙更新时间：2023-11-03 17:04:13

26

4

我有一组问题，我希望能够回答这些问题，而不必使用 SQL 来回答它们。当我决定在 Python 中进行树遍历更容易时，我在查询中进行了大约 9 个子选择。

问题是，当我尝试使用 Python 将我关心的所有数据(32 亿行)获取到我的机器时，内存不足。

from collections import namedtuple, defaultdict

state_change = namedtuple("state_change", ["event", "phase", "datetime"])

sql = """
SELECT *
FROM job_history
WHERE job = 'job_name'"""

# Now we need to assosciate job states, and times.
jobs = defaultdict(list) # Key is the job id, list of state changes

for row in get_media_scan_data(sql):
    jobs[row[7]].append(state_change(
        row[8],
        row[10],
        row[5],))

单个行看起来像

datetime                job         job_id  event               impact_policy   phase
2000-06-10 08:44:04.000 job_name    4165    begin inode verify  NULL            4

此问题的一个解决方案是在数据窗口上进行计算。比如说前 200,000 行，然后是 200,001 到 400,000 行，等等。

是否有一种更有效的内存方式来在本地存储这些数据？如果我可以避免多次重新下载数据集(使用 Windows)，这将节省大量时间。

最佳答案

对于数十亿行，您显然需要某种磁盘持久性。看看bsddb模块，它是一个非常快速的嵌入式键值存储。一个小例子(注意在 python 3 上存储值的一种奇怪的方式):

import bsddb3.db as db
def bsdtest():
    d = db.DB()
    d.open('test.db', dbtype=db.DB_HASH, flags=db.DB_CREATE)
    # d.exists()
    for key in range(1000000):
        d.put(bytes(str(key), encoding='ascii'), 
              bytes(str('value'), encoding='ascii'))
    d.close()

关于python - 在 Python 中使用命名元组字典导致内存不足，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/34735973/

26

4

0

文章推荐： python - Heroku:如何在部署时自动启动 Python 应用程序？

文章推荐： c# - MemoryMappedFile 流的死锁

文章推荐： c# - 使用 LINQ Lambda 表达式获取值为 NULL 的列

文章推荐： python - python 写入输出 csv 文件

SQL 查询导致我 sleep 不足
所以我正在为考试复习，并在 SQL 河(或荒地)中撞到了一块大石头我制作了以下表格并插入了以下数据: create table Permissions ( fileName VARCHAR(
JQueryUI 对话框 maxWidth 不足
我有一个使用 maxWidth 定义的 jqueryui 对话框。 $("#myDialog").dialog({ autoOpen: false, width: 'a
c - 如何使用平方根优化c中的循环(完美、丰富、不足)
注意:我遗漏了不相关的代码所以我目前正在研究 CCC 1996 P1，这个问题的全部目的是能够计算一个整数输入是完美数、不足数还是充数。我上面列出的代码可以工作，但是我认为它太慢了。该代码会迭代每个
r - R 中的关联规则 RAM 不足
已关闭。此问题需要 debugging details 。目前不接受答案。编辑问题以包含 desired behavior, a specific problem or error, and the
python - Redis 使用的 RAM 不足
我正在使用 Go 和 Redis 开发 API。问题是RAM使用不足，我找不到问题的根源。 TL;DR 版本有数百/数千个哈希对象。每个 1 KB 的对象(键+值)占用大约 0.5 MB 的 RAM
kubernetes - 由于 CPU 不足，Pod 处于挂起状态
在我的 GCE Kubernetes 集群上，我无法再创建 pod。 Warning FailedScheduling pod (www.caveconditions.com-f1be467e3
kubernetes - Amazon EKS Fargate中的 pod 不足
当我尝试在EKS Fargate群集上安装指标服务器时，它抛出错误: 0/4 nodes are available: 4 Insufficient pods. 按照以下说明从此处安装指标服务器:ht
ios - 为什么 iOS 终止后台应用程序而不是以不同方式处理 RAM 不足？
遍布this document Apple 提到 iOS 在某些情况下会终止应用程序，最常见的原因似乎是释放一些 RAM。这会导致未实现状态恢复的应用程序出现问题——用户正在处理和暂时离开的一些内容可
audio - Google Cloud Speech:配额组 token 不足
尝试处理一个10分钟的音频文件时出现以下错误。我刚刚开始使用Google Cloud产品，所以我是唯一访问此资源的人。我怎么可能超出配额？配额设置为其默认值，我认为我没有任何限制。还有其他原因吗？我
r - 对R中事物类型的全面考察； 'mode' 和 'class' 和 'typeof' 不足
R 语言让我感到困惑。实体有模式和类，但即使这样也不足以完全描述实体。这个answer说 In R every 'object' has a mode and a class. 所以我做了这些实验:
kubernetes - Openshift:没有与以下所有谓词匹配的可用节点::cpu 不足 (173)、MatchNodeSelector (5)
我在 west-1 有一个 Openshift v3 项目。在其中，我有一个运行良好的应用程序，但在 GitHub 提交代码中非常下游的内容后，该应用程序停止工作。问题在于制作 pod: No nod
kubernetes - Openshift:没有与以下所有谓词匹配的可用节点::cpu 不足 (173)、MatchNodeSelector (5)
我在 west-1 有一个 Openshift v3 项目。在其中，我有一个运行良好的应用程序，但在 GitHub 提交代码中非常下游的内容后，该应用程序停止工作。问题在于制作 pod: No nod
wolfram-mathematica - 我可以使用 Stackoverflow API 检查哪些 SO 回答者 sleep 不足？
在 how-do-i-access-the-stackoverflow-api-from-mathematica我概述了如何使用 SO API 让 Mathematica 制作一些有趣的顶级回答者声誉
node.js - 小型 Node.js 应用程序 Pod 的 GKE CPU 不足
所以在 GKE 上，我有一个 Node.js app，每个 pod 使用大约:CPU(cores): 5m, MEMORY: 100Mi 但是我只能为每个 Node 部署 1 个 pod。我使用的是
javascript - 消费者的服务 'AnalyticsDefaultGroup' 的配额 'USER-100s' 和限制 'analyticsreporting.googleapis.com' 的 token 不足
我正在使用 async.eachOfSeries 超过 300 个数组并请求一些 GA api，它工作正常但有时我会收到错误.. UnhandledPromiseRejectionWarning:错误
amazon-s3 - 0/3 个节点可用 : 1 node(s) had taints that the pod didn't tolerate, 2 cpu 不足。 MR3 hive
我正在尝试在 AWS ec2 上托管的 kubernetes 集群上使用 mr3 设置配置单元。当我运行命令 run-hive.sh 时，Hive 服务器启动，并且 master-DAg 被初始化，但
google-cloud-pubsub - 消费者 'administrator' 的服务 'CLIENT_PROJECT-100s' 的配额 'pubsub.googleapis.com' 和限制 'project_number:#' 的 token 不足
创建订阅时有时会出现以下错误: Insufficient tokens for quota 'administrator' and limit 'CLIENT_PROJECT-100s' of ser

首页

博学

6Ren·AI

商城

python - 在 Python 中使用命名元组字典导致内存不足