- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我的机器学习脚本生成大量数据(一个根 BTree
中包含数百万个 BTree
)并将其存储在 ZODB 的 FileStorage
中,主要是因为所有这些都无法放入 RAM 中。脚本还经常修改先前添加的数据。
当我增加问题的复杂性,因此需要存储更多数据时,我注意到性能问题 - 脚本现在计算数据的速度平均慢两倍甚至十倍(唯一改变的是数据量)进行存储并稍后检索以进行更改)。
我尝试将 cache_size
设置为 1000 到 50000 之间的各种值。说实话,速度差异可以忽略不计。
我想过切换到 RelStorage
但不幸的是在 the docs 中他们只提到了如何配置 Zope 或 Plone 等框架。我只使用 ZODB。
我想知道 RelStorage
在我的情况下是否会更快。
以下是我当前设置 ZODB 连接的方式:
import ZODB
connection = ZODB.connection('zodb.fs', ...)
dbroot = connection.root()
我很清楚 ZODB 目前是我脚本的瓶颈。我正在寻求有关如何解决此问题的建议。
我选择 ZODB 是因为我认为 NoSQL 数据库更适合我的情况,而且我喜欢类似于 Python 的 dict
的界面理念。
代码和数据结构:
根数据结构:
if not hasattr(dbroot, 'actions_values'):
dbroot.actions_values = BTree()
if not hasattr(dbroot, 'games_played'):
dbroot.games_played = 0
actions_values
在概念上构建如下:
actions_values = { # BTree
str(state): { # BTree
# contiains actions (coulmn to pick to be exact, as I'm working on agent playing Connect 4)
# and their values(only actions previously taken by the angent are present here), e.g.:
1: 0.4356
5: 0.3456
},
# other states
}
state
是一个表示游戏板的简单二维数组。其字段的可能值为 1
、2
或 None
:
board = [ [ None ] * cols for _ in xrange(rows) ]
(在我的例子中,行数 = 6 和列数 = 7)
主循环:
should_play = 10000000
transactions_freq = 10000
packing_freq = 50000
player = ReinforcementPlayer(dbroot.actions_values, config)
while dbroot.games_played < should_play:
# max_epsilon at start and then linearly drops to min_epsilon:
epsilon = max_epsilon - (max_epsilon - min_epsilon) * dbroot.games_played / (should_play - 1)
dbroot.games_played += 1
sys.stdout.write('\rPlaying game %d of %d' % (dbroot.games_played, should_play))
sys.stdout.flush()
board_state = player.play_game(epsilon)
if(dbroot.games_played % transactions_freq == 0):
print('Commiting...')
transaction.commit()
if(dbroot.games_played % packing_freq == 0):
print('Packing DB...')
connection.db().pack()
(打包
也需要很多时间,但这不是主要问题;我可以在程序完成后打包数据库)
在 dbroot
上运行的代码(在 ReinforcementPlayer
内):
def get_actions_with_values(self, player_id, state):
if player_id == 1:
lookup_state = state
else:
lookup_state = state.switch_players()
lookup_state_str = str(lookup_state)
if lookup_state_str in self.actions_values:
return self.actions_values[lookup_state_str]
mirror_lookup_state_str = str(lookup_state.mirror())
if mirror_lookup_state_str in self.actions_values:
return self.mirror_actions(self.actions_values[mirror_lookup_state_str])
return None
def get_value_of_action(self, player_id, state, action, default=0):
actions = self.get_actions_with_values(player_id, state)
if actions is None:
return default
return actions.get(action, default)
def set_value_of_action(self, player_id, state, action, value):
if player_id == 1:
lookup_state = state
else:
lookup_state = state.switch_players()
lookup_state_str = str(lookup_state)
if lookup_state_str in self.actions_values:
self.actions_values[lookup_state_str][action] = value
return
mirror_lookup_state_str = str(lookup_state.mirror())
if mirror_lookup_state_str in self.actions_values:
self.actions_values[mirror_lookup_state_str][self.mirror_action(action)] = value
return
self.actions_values[lookup_state_str] = BTree()
self.actions_values[lookup_state_str][action] = value
(名称中带有mirror的函数只是简单地反转列( Action )。这样做是因为连接4 block 彼此垂直反射的板是等效的。)
550000 场比赛后 len(dbroot.actions_values)
为 6018450。
根据 iotop
IO 操作占用了 90% 的时间。
最佳答案
使用任何(其他)数据库可能都没有帮助,因为它们与 ZODB 一样受到相同的磁盘 IO 和内存限制。如果您设法将计算卸载到数据库引擎本身(PostgreSQL + 使用 SQL 脚本),它可能会有所帮助,因为数据库引擎将有更多信息来做出如何执行代码的明智选择,但这里没有什么神奇的,同样的事情也可以使用 ZODB 很可能可以轻松完成。
一些可以做什么的想法:
拥有数据索引而不是加载完整对象(相当于SQL“全表扫描”)。保持智能预处理数据副本:索引、总和、部分。
使对象本身更小(Python 类有 __slots__ 技巧)
以智能方式使用交易。不要尝试在一个大块中处理所有数据。
并行处理 - 使用所有 CPU 核心而不是单线程方法
不要使用 BTree - 也许有更适合您的用例的方法
拥有一些脚本代码示例、实际 RAM 和 Data.fs 大小等将有助于提供进一步的想法。
关于python - 如何提高处理大量数据的脚本的性能?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/34597386/
我有 powershell 脚本。通过调度程序,我运行 bat 文件,该文件运行 PS1 文件。 BAT文件 Powershell.exe -executionpolicy remotesigned
什么更快? 或者 $.getScript('../js/SOME.js', function (){ ... // with $.ajaxSetup({ cache: true });
需要bash脚本来显示文件 #!/bin/bash my_ls() { # save current directory then cd to "$1" pushd "$1" >/dev/nu
我有一个输入 csv 文件,实际上我需要在输入文件中选择第 2 列和第 3 列值,并且需要转换两个值的时区(从 PT 到 CT),转换后我需要替换转换后的时区值到文件。 注意: 所有输入日期值都在太平
我正在使用/etc/init.d/httpd 作为 init.d 脚本的模板。我了解文件中发生的所有内容,但以下行除外: LANG=$HTTPD_LANG daemon --pidfile=${pid
我有以下选择: python runscript.py -O start -a "-a "\"-o \\\"-f/dev/sda1 -b256k -Q8\\\" -l test -p maim\""
我对 shell 脚本完全陌生,但我需要编写一个 shell 脚本来检查文件是否存在,然后移动到另一个位置 这是我写的: 一旦设备崩溃,我就会在/storage/sdcard1/1 中收集日志 #!/
我正在使用 bash 脚本从文本文件中读取数据。 数据: 04:31 Alex M.O.R.P.H. & Natalie Gioia - My Heaven http://goo.gl/rMOa2q
这是单击按钮时运行的 javascript 的结尾 xmlObj.open ('GET', /ajax.php, true); xmlObj.send (''); } 所以这会执行根目录中的php脚本
关闭。这个问题需要debugging details .它目前不接受答案。 编辑问题以包含 desired behavior, a specific problem or error, and th
我需要将文件转换为可读流以通过 api 上传,有一个使用 fs.createReadStream 的 Node js 示例。任何人都可以告诉我上述声明的 python 等价物是什么? 例子 const
我有一个 shell 脚本 cron,它从同一目录调用 python 脚本,但是当这个 cron 执行时,我没有从我的 python 脚本中获得预期的输出,当我手动执行它时,我的 python 脚本的
如何使 XMLHttpRequest (ajax) 调用的 php 脚本安全。 我的意思是,不让 PHP 文件通过直接 url 运行,只能通过脚本从我的页面调用(我不想向未登录的用户显示数据库结果,并
我正在尝试添加以下内容 我正在使用经典的 asp。但我不断收到的错误是“一个脚本 block 不能放在另一个脚本 block 内。”我尝试了此处的 document.write 技术:Javasc
如何从另一个 PHP 脚本(如批处理文件)中运行多个 PHP 脚本?如果我了解 include 在做什么,我认为 include 不会起作用;因为我正在运行的每个文件都会重新声明一些相同的函数等。我想
我想创建具有动态内容的网页。我有一个 HTML 页面,我想从中调用一个 lua 脚本 如何调用 lua 脚本? ? ? 从中检索数据?我可以做类似的事情吗: int xx = 0; xx
我删除了我的第一个问题,并重新编写了更多细节和附加 jSfiddle domos。 我有一个脚本,它运行查询并返回数据,然后填充表。表中的行自动循环滚动。所有这些工作正常,并通过使用以下代码完成。然而
我尝试使用 amp 脚本,但收到此错误: “[amp-script] 脚本哈希未找到。amp-script[script="hello-world"].js 必须在元[name="amp-script
我有一个读取输入的 Shell 脚本 #!/bin/bash echo "Type the year that you want to check (4 digits), followed by [E
我正在从 nodejs 调用 Lua 脚本。我想传递一个数组作为参数。我在 Lua 中解析该数组时遇到问题。 下面是一个例子: var script = 'local actorlist = ARGV
我是一名优秀的程序员,十分优秀!