- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
这是一个 Park-Miller 伪随机数生成器:
def gen1(a=783):
while True:
a = (a * 48271) % 0x7fffffff
yield a
783
只是一个任意种子。
48271
是 Park 和 Miller 在原论文中推荐的系数 (PDF:
Park, Stephen K.; Miller, Keith W. (1988). "Random Number Generators: Good Ones Are Hard To Find" )
A prime modulus requires the computation of a double-width product and an explicit reduction step. If a modulus just less than a power of 2 is used (the Mersenne primes 231−1 and 261−1 are popular, as are 232−5 and 264−59), reduction modulo m = 2e − d can be implemented more cheaply than a general double-width division using the identity 2e ≡ d (mod m).
0x7fffffff
实际上是梅森素数 2**32 - 1,这里是在 Python 中实现的想法:
def gen2(a=783):
while True:
a *= 48271
a = (a & 0x7fffffff) + (a >> 31)
a = (a & 0x7fffffff) + (a >> 31)
yield a
基本基准脚本:
import time, sys
g1 = gen1()
g2 = gen2()
for g in g1, g2:
t0 = time.perf_counter()
for i in range(int(sys.argv[1])): next(g)
print(g.__name__, time.perf_counter() - t0)
pypy (7.3.0 @ 3.6.9) 中的性能有所提高,例如生成 100 M 项:
$ pypy lcg.py 100000000
gen1 0.4366550260456279
gen2 0.3180829349439591
不幸的是,性能实际上在 CPython (3.9.0/Linux) 中下降了:
$ python3 lcg.py 100000000
gen1 20.650125587941147
gen2 26.844335232977755
我的问题:
>>> 0x7fffffff.bit_length()
31
最佳答案
我的猜测是,在 CPython 版本中,大部分时间都花在了开销(解释器、动态调度)上,而不是实际的算术运算上。因此,添加更多步骤(即更多开销)并没有多大帮助。
PyPy 的运行时间看起来更像是使用 C 整数进行 10^8 模运算所需的时间,因此它可能能够使用 JIT,它没有太多开销,因此我们可以看到算术运算的加速.
减少开销的一种可能方法是使用 Cython(here 是我对 Cython 如何帮助减少解释器和调度开销的调查),并且为生成器开箱即用:
%%cython
def gen_cy1(int a=783):
while True:
a = (a * 48271) % 0x7fffffff
yield a
def gen_cy2(int a=783):
while True:
a *= 48271
a = (a & 0x7fffffff) + (a >> 31)
a = (a & 0x7fffffff) + (a >> 31)
yield a
我使用以下函数进行测试:
def run(gen,N):
for i in range(N): next(gen)
和测试表明:
N=10**6
%timeit run(gen1(),N) # 246 ms
%timeit run(gen2(),N) # 387 ms
%timeit run(gen_cy1(),N) # 114 ms
%timeit run(gen_cy2(),N) # 107 ms
两个 Cython 版本都同样快(并且比原始版本快一些),因为有更多的操作,实际上并不会花费更多的开销,因为算术运算是用 C-int 完成的,不再用 Python-int 完成。
%%cython
def gen_last_cy1(int n, int a=783):
cdef int i
for i in range(n):
a = (a * 48271) % 0x7fffffff
return a
def gen_last_cy2(int n, int a=783):
cdef int i
for i in range(n):
a *= 48271
a = (a & 0x7fffffff) + (a >> 31)
a = (a & 0x7fffffff) + (a >> 31)
return a
导致以下时间:
N=10**6
%timeit gen_last_cy1(N) # 7.21 ms
%timeit gen_last_cy2(N) # 2.59 ms
如果不使用发电机,那意味着可以节省 90% 以上的运行时间!
-O2
) 为原始版本生成的汇编程序(在
gotbold.org 上运行):
imull $48271, %edi, %edi
movslq %edi, %rdx
movq %rdx, %rax
salq $30, %rax
addq %rdx, %rax
movl %edi, %edx
sarl $31, %edx
sarq $61, %rax
subl %edx, %eax
movl %eax, %edx
sall $31, %edx
subl %eax, %edx
movl %edi, %eax
subl %edx, %eax
如你所见,没有
div
.
imull $48271, %edi, %eax
movl %eax, %edx
sarl $31, %eax
andl $2147483647, %edx
addl %edx, %eax
movl %eax, %edx
sarl $31, %eax
andl $2147483647, %edx
addl %edx, %eax
显然,更少的操作并不总是意味着更快的代码,但在这种情况下似乎确实如此。
关于python - 加速 Python 中的模运算,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/65909389/
为什么 (defun boolimplies (a b) (or (not a) b)) if called as(boolimplies 'a 'b) 返回 B? 即使我不使用任何 boolean
这个问题已经有答案了: Are there builtin functions for elementwise boolean operators over boolean lists? (5 个回答
我正在寻求帮助以使以下功能看起来更清晰。我觉得我可以通过使用更少的代码行来实现同样的目标。 标题看起来一定很困惑,所以让我详细说明一下。我创建了一个函数,它接受用户输入(即 72+5),将字符串拆分为
我正在学习 C++ 并尝试为矩阵编写一个 C++ 类,我在其中将矩阵存储为一维 C 数组。为此,我定义了一个 element成员函数根据矩阵元素在数组中的位置访问矩阵元素。然后我重载了 class
我正在学习 C++ 并尝试为矩阵编写一个 C++ 类,我在其中将矩阵存储为一维 C 数组。为此,我定义了一个 element成员函数根据矩阵元素在数组中的位置访问矩阵元素。然后我重载了 class
伙计们,以下内容不起作用 函数返回 true,变量返回 false,但它不会进入 when 子句。我尝试像这样放大括号 但是当我将变量的值设置为 true 并将上面的代码更改为 它进入w
关闭。此题需要details or clarity 。目前不接受答案。 想要改进这个问题吗?通过 editing this post 添加详细信息并澄清问题. 已关闭 9 年前。 Improve th
我是原生 C 语言的新手,但我没有看到错误。 我尝试在这种情况下使用 if 操作: #define PAGE_A 0 #define PAGE_B 1 int pageID = 0; if (page
我正在从事一个项目,让用户鼠标滚轮移动并知道它向上或向下滚动。在我的代码中,我可以上下移动。但我想将 Action 保存到一个字符串中。例如,如果用户向上向上向下滚动'mhmh' 显示返回“UUD”但
我有一个 MySQL 表 payment我在其中存储客户的所有付款相关数据。表字段为:fileNo , clientName , billNo , billAmount , status 。我想构建一
我的表架构如下: +------+-------+-------+
我有这个(顺便说一句,我刚刚开始学习): #include #include using namespace std; int main() { string mystr; cout << "We
我正在用 bash 构建一个用于 Linux (SLES 11SP3) 的脚本。我想通过使用以下语法查找它的 pid 来检查某个进程是否存在: pid="$(ps -ef | grep -v grep
我有一个包含两列的表格; CREATE TABLE IF NOT EXISTS `QUESTION_CATEGORY_RELATION` ( `question_id` int(16) NOT N
我对 Python 如何计算 bool 语句感到困惑。 例如 False and 2 or 3 返回 3 这是如何评估的?我认为 Python 首先会查看“False and 2”,甚至不查看“or
这个问题在这里已经有了答案: 12 年前关闭。 这可能是非常基本的......但我似乎不明白: 如何 (2 & 1) = 0 (3 & 1) = 1 (4 & 1) = 0 等等.. 上面的这种模式似
无论如何在Haskell中定义如下函数? or True True = True or True undefined = True or True False
如您所知,TCL 有一些数学函数,例如 罪 , 因 , 和 假设 在 中调用的expr 带有 的命令() 大括号如下: puts [expr sin(1.57)] 现在如何使用 TCL 添加功能 li
让我们考虑两个数组列表。 ArrayList list1 = new ArrayList(); list1.add(1); list1.add(2); list1.add(3); ArrayList
我想包含和排除使用AND和OR的专业知识,包括与AND和OR操作正常工作。但是,当将排除专家与AND和OR一起使用时,返回与3相同的结果计数。我使用的是1.4版 Elasticsearch 。帮助我解
我是一名优秀的程序员,十分优秀!