python - 加速 Python 中的模运算-6ren

python - 加速 Python 中的模运算

转载作者：行者123 更新时间：2023-12-04 13:29:29

26

4

这是一个 Park-Miller 伪随机数生成器:

def gen1(a=783):
    while True:
        a = (a * 48271) % 0x7fffffff
        yield a

783 只是一个任意种子。 48271 是 Park 和 Miller 在原论文中推荐的系数 (PDF: Park, Stephen K.; Miller, Keith W. (1988). "Random Number Generators: Good Ones Are Hard To Find" )
我想提高这个 LCG 的性能。文献描述了一种使用按位技巧 ( source) 避免除法的方法:

A prime modulus requires the computation of a double-width product and an explicit reduction step. If a modulus just less than a power of 2 is used (the Mersenne primes 2³¹−1 and 2⁶¹−1 are popular, as are 2³²−5 and 2⁶⁴−59), reduction modulo m = 2^e − d can be implemented more cheaply than a general double-width division using the identity 2^e ≡ d (mod m).

注意到模数 0x7fffffff 实际上是梅森素数 2**32 - 1，这里是在 Python 中实现的想法:

def gen2(a=783):
    while True:
        a *= 48271
        a = (a & 0x7fffffff) + (a >> 31)
        a = (a & 0x7fffffff) + (a >> 31)
        yield a

基本基准脚本:

import time, sys

g1 = gen1()
g2 = gen2()

for g in g1, g2:
    t0 = time.perf_counter()
    for i in range(int(sys.argv[1])): next(g)
    print(g.__name__, time.perf_counter() - t0)

pypy (7.3.0 @ 3.6.9) 中的性能有所提高，例如生成 100 M 项:

$ pypy lcg.py 100000000
gen1 0.4366550260456279
gen2 0.3180829349439591

不幸的是，性能实际上在 CPython (3.9.0/Linux) 中下降了:

$ python3 lcg.py 100000000
gen1 20.650125587941147
gen2 26.844335232977755

我的问题:

为什么通常被吹捧为优化的按位算术实际上比 CPython 中的模运算还要慢？

您能否以其他方式在 CPython 下提高此 PRNG 的性能，也许使用 numpy 或 ctypes ？

请注意，此处不一定需要任意精度整数，因为此生成器永远不会产生比以下更长的数字:

>>> 0x7fffffff.bit_length()
31

最佳答案

我的猜测是，在 CPython 版本中，大部分时间都花在了开销(解释器、动态调度)上，而不是实际的算术运算上。因此，添加更多步骤(即更多开销)并没有多大帮助。
PyPy 的运行时间看起来更像是使用 C 整数进行 10^8 模运算所需的时间，因此它可能能够使用 JIT，它没有太多开销，因此我们可以看到算术运算的加速.
减少开销的一种可能方法是使用 Cython(here 是我对 Cython 如何帮助减少解释器和调度开销的调查)，并且为生成器开箱即用:

%%cython
def gen_cy1(int a=783):
    while True:
        a = (a * 48271) % 0x7fffffff
        yield a
        
def gen_cy2(int a=783):
    while True:
        a *= 48271
        a = (a & 0x7fffffff) + (a >> 31)
        a = (a & 0x7fffffff) + (a >> 31)
        yield a

我使用以下函数进行测试:

def run(gen,N):
    for i in range(N): next(gen)

和测试表明:

N=10**6
%timeit run(gen1(),N)   #  246 ms
%timeit run(gen2(),N)   #  387 ms
%timeit run(gen_cy1(),N)   # 114 ms
%timeit run(gen_cy2(),N)   # 107 ms

两个 Cython 版本都同样快(并且比原始版本快一些)，因为有更多的操作，实际上并不会花费更多的开销，因为算术运算是用 C-int 完成的，不再用 Python-int 完成。
但是，如果真的很想获得最佳性能 - 使用生成器是一个杀手，因为它意味着大量开销(例如，请参见 SO-post )。
只是为了给人一种感觉，如果不使用 Python 生成器，可能会发生什么 - 生成所有数字的函数(但不要将它们转换为 Python 对象，因此没有开销):

%%cython
def gen_last_cy1(int n, int a=783):
    cdef int i
    for i in range(n):
        a = (a * 48271) % 0x7fffffff
    return a

def gen_last_cy2(int n, int a=783):
    cdef int i
    for i in range(n):
        a *= 48271
        a = (a & 0x7fffffff) + (a >> 31)
        a = (a & 0x7fffffff) + (a >> 31)
    return a

导致以下时间:

N=10**6
%timeit gen_last_cy1(N)  # 7.21 ms
%timeit gen_last_cy2(N)  # 2.59 ms

如果不使用发电机，那意味着可以节省 90% 以上的运行时间!

我有点惊讶，调整后的第二个版本优于最初的第一个版本。通常，如果可能，C 编译器不会直接执行模运算，而是自己使用位技巧。但是在这里，C 编译器的技巧至少在我的机器上是逊色的。
由 gcc ( -O2 ) 为原始版本生成的汇编程序(在 gotbold.org 上运行):

        imull   $48271, %edi, %edi
        movslq  %edi, %rdx
        movq    %rdx, %rax
        salq    $30, %rax
        addq    %rdx, %rax
        movl    %edi, %edx
        sarl    $31, %edx
        sarq    $61, %rax
        subl    %edx, %eax
        movl    %eax, %edx
        sall    $31, %edx
        subl    %eax, %edx
        movl    %edi, %eax
        subl    %edx, %eax

如你所见，没有 div .
这里是第二个版本的汇编程序(操作少得多):

        imull   $48271, %edi, %eax
        movl    %eax, %edx
        sarl    $31, %eax
        andl    $2147483647, %edx
        addl    %edx, %eax
        movl    %eax, %edx
        sarl    $31, %eax
        andl    $2147483647, %edx
        addl    %edx, %eax

显然，更少的操作并不总是意味着更快的代码，但在这种情况下似乎确实如此。

关于python - 加速 Python 中的模运算，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/65909389/

26

4

0

文章推荐： multicore - 多核系统的编程和编译状态

文章推荐： regex - 匹配文化名称的正则表达式是什么？

文章推荐： python - 计算某些文本中多字子串的出现次数

algorithm - n!模 m , a^p 模 m
是否有更快的算法来计算 (n! modulo m)。在每个乘法步骤都比减少更快。并且有没有比左右二元法更快的算法来计算 (a^p modulo m)。这是我的代码:n!模数m ans=1 for(i
javascript - if 条件满足但不适用(模)
我有非常简单的代码循环遍历数组中的元素并检查是否index % 2 == 0。如果是这样，它应该改变颜色。 var e = document.getElementById("list").childN
javascript - 模 - 计算错误
让我简短一点。我正在计算 alert((Math.pow(7,35))%71) 但它给了我 61，而结果必须是 70。怎么了？最佳答案正如其他人之前提到的关于使用 Math.pow(7,35) 的
gcc - 模(%)的GCC实现是如何工作的，为什么不使用div指令？
我试图弄清楚如何在汇编中计算模 10，所以我在 gcc 中编译了以下 c 代码，看看它想出了什么。 unsigned int i=999; unsigned int j=i%10; 令我惊讶的是我得到
java - 如何在不使用 "%"运算符的情况下计算两个数字的余数/模？
例如使用以下输入: int num = -100 int divisor = 10 => -100 mod 10 = 0 (Edge-case: negative numbers as inpu
C++ rand() 模 float
这个问题在这里已经有了答案: Random float number generation (14 个答案) 关闭 9 年前。在 C++ 中，我希望得到一个随机 float 。据我所知，典型的随机
c - 相同除数时快速 AVX512 模
我试图找到潜在阶乘素数的除数(n!+-1 形式的数)，因为我最近购买了 Skylake-X 工作站，我认为我可以使用 AVX512 指令提高一些速度。算法简单，主要步骤是对同一个除数重复取模。主要是
math - 如何找到与 i 模 m 一致的最小正整数？
我有一个保存角度(以度为单位)的变量，该角度可以是正值也可以是负值。我现在需要确保该数字仅在 0 到 360 之间。该数字是 double 。执行此操作的好算法是什么？简单地执行角度 % 360 是
swift - CheckSum8 模 256 Swift
我有一个 UInt8 数组，我想计算 CheckSum8 模 256。如果字节总和小于 255，checkSum 函数返回正确的值。例如 let bytes1 : [UInt8] = [1, 0xa
我可以依赖 C 中的 %(模)运算符来获取负数吗？
使用海湾合作委员会: printf("%i \n", -1 % (int)4); printf("%u \n", -1 % (unsigned int)4); 输出: -1 3 我可以跨平台依赖这种行
c++ - 模 : The Purpose of An Undefined Integer
我无法理解代码中几行的含义。我最近开始学习 C++，并阅读了 Bjarne Stroustrup 的“编程:使用 C++ 的原理和实践”。第四章有个问题让我很困惑，所以我在网上搜索了一个解决方案以供引
algorithm - 解释以下算法以求 nCr 模 P
我试图解决一个涉及大阶乘模质数的问题，并在另一个人的解决方案中发现了以下算法: long long factMod (long long n, long long p) { long long
java - 斐波那契 n 模 m
我正在尝试计算 𝐹𝑛 模 𝑚，其中 𝑛 可能非常大:高达 10^18，𝐹𝑛 是第 n 个斐波那契数这是我的代码，它适用于小数字，但对于大数字，它会抛出 OutOfMemoryError 或
algorithm - 检查循环(模 16)数是否大于另一个？
我有两个以 16 为模的循环整数，因此它们的值介于 0 和 15 之间。我需要比较两个数字以确定 n_1 是否大于 n_0 n_1 > n_0 很明显，这个没有准确定义，所以我定义n_1如果小于前面
java - 一些 Java 模/余数运算符问题
我一直在尝试使用 Java 处理一些更大的值，但遇到了一些我不理解的问题。出于某种原因，Java 似乎喜欢给我垃圾数据(尽管，我更可能告诉它给我垃圾数据) 这是一个片段，为清楚起见进行了编辑:
c++ - 模 - gcc 的操作数顺序错误？还是UB？
好吧，我今天做了一个小函数，它应该会生成一个随机字符串。 std::string randString(size_t length) { std::string randStr; fo
带负数的 Ruby 模 3 不直观
Ruby 的负数取模规则不明确。在 IRB 中: -7 % 3 == 2 应该是1!为什么？最佳答案因为 -7/3 在 Ruby 的整数除法语义下是 -3。 3*-3 是 -9，所以会留下 2
javascript - 模 % 大数 - 无穷大错误 - Javascript
这个问题在这里已经有了答案: Calculating pow(a,b) mod n (14 个答案) 关闭 6 年前。在 Javascript 中是否有获取大数模数的技巧。我用 modulo(7,
lua - 2^65 模 101 错误答案
此代码使用公式 (a^x) % 101 检查值 a 是否唯一映射到值 1 到 100 local function f(a) found = {} bijective = true
java - 模 32 或 64 约简是什么？
在《Core Java Volume1》一书中有一条警告: CAUTION: The right-hand side argument of the shift operators is reduce

首页

博学

6Ren·AI

商城

python - 加速 Python 中的模运算