sse - 在 x86(使用 SSE2)和 ARM(使用 vfpv4 NEON)上的尾数为 11 位的 atan2 近似值-6ren

sse - 在 x86(使用 SSE2)和 ARM(使用 vfpv4 NEON)上的尾数为 11 位的 atan2 近似值

转载作者：行者123 更新时间：2023-12-04 14:31:07

36

4

我正在尝试在尾数中以 11 位精度实现快速 atan2(float)。
atan2 实现将用于图像处理。
所以最好用 SIMD 指令来实现(目标是 x86(带 SSE2)和 ARM(带 vpfv4 NEON))。

现在，我使用切比雪夫多项式近似( https://jp.mathworks.com/help/fixedpoint/examples/calculate-fixed-point-arctangent.html )。

我愿意手动实现矢量化代码。
我将使用 SSE2(或更高版本)和 NEON 包装器库。
我计划或尝试了这些实现选项

矢量化多项式逼近

切比雪夫多项式(现已实现)

标量查找表(+ 线性插值)

矢量化查找表(这可能吗？我不熟悉 NEON，所以我不知道一些指令，例如 NEON 中的 VGATHER)

矢量化 CORDIC 方法(这可能很慢，因为它需要 12 次以上的旋转迭代才能获得 11 位精度)

还有什么好主意？

最佳答案

您要检查的第一件事是您的编译器在应用于 atan2f (y,x) 数组时是否能够对 float 进行矢量化。这通常至少需要高优化级别，例如 -O3，并可能指定一种宽松的“快速数学”模式，其中 errno 处理、非正规数和特殊输入(例如无穷大和 NaN)在很大程度上被忽略。使用这种方法，准确性可能远远超过所需，但在性能方面可能很难击败经过仔细调整的库实现。

接下来要尝试的是编写一个具有足够精度的简单标量实现，并让编译器对其进行矢量化。通常，这意味着避免任何非常简单的分支，这些分支可以通过 if-conversion 转换为无分支代码。此类代码的一个示例是如下所示的 fast_atan2f()。使用作为 icl /O3 /fp:precise /Qvec_report=2 my_atan2f.c 调用的英特尔编译器，这已成功矢量化: my_atan2f.c(67): (col. 9) remark: LOOP WAS VECTORIZED. 通过反汇编对生成的代码进行双重检查表明 fast_atan2f() 已使用 *ps 风格的 SSE 指令进行内联和矢量化。

如果一切都失败了，您可以手动将 fast_atan2() 的代码转换为特定于平台的 SIMD 内在函数，这应该不难做到。我没有足够的经验来快速完成。

我在这段代码中使用了一个非常简单的算法，它是一个简单的参数约简以在 [0,1] 中生成一个约简参数，然后是一个极小极大多项式近似，最后一步将结果映射回完整的圆。核心近似是使用 Remez 算法生成的，并使用二阶霍纳方案进行评估。如果可用，可以使用融合乘法加法 (FMA)。出于性能考虑，不处理涉及无穷大、NaN 或 0/0 的特殊情况。

#include <stdio.h>
#include <stdlib.h>
#include <math.h>

/* maximum relative error about 3.6e-5 */
float fast_atan2f (float y, float x)
{
    float a, r, s, t, c, q, ax, ay, mx, mn;
    ax = fabsf (x);
    ay = fabsf (y);
    mx = fmaxf (ay, ax);
    mn = fminf (ay, ax);
    a = mn / mx;
    /* Minimax polynomial approximation to atan(a) on [0,1] */
    s = a * a;
    c = s * a;
    q = s * s;
    r =  0.024840285f * q + 0.18681418f;
    t = -0.094097948f * q - 0.33213072f;
    r = r * s + t;
    r = r * c + a;
    /* Map to full circle */
    if (ay > ax) r = 1.57079637f - r;
    if (x <   0) r = 3.14159274f - r;
    if (y <   0) r = -r;
    return r;
}

/* Fixes via: Greg Rose, KISS: A Bit Too Simple. http://eprint.iacr.org/2011/007 */
static unsigned int z=362436069,w=521288629,jsr=362436069,jcong=123456789;
#define znew (z=36969*(z&0xffff)+(z>>16))
#define wnew (w=18000*(w&0xffff)+(w>>16))
#define MWC  ((znew<<16)+wnew)
#define SHR3 (jsr^=(jsr<<13),jsr^=(jsr>>17),jsr^=(jsr<<5)) /* 2^32-1 */
#define CONG (jcong=69069*jcong+13579)                     /* 2^32 */
#define KISS ((MWC^CONG)+SHR3)

float rand_float(void)
{
    volatile union {
        float f;
        unsigned int i;
    } cvt;
    do {
        cvt.i = KISS;
    } while (isnan(cvt.f) || isinf (cvt.f) || (fabsf (cvt.f) < powf (2.0f, -126)));
    return cvt.f;
}

int main (void)
{
    const int N = 10000;
    const int M = 100000;
    float ref, relerr, maxrelerr = 0.0f;
    float arga[N], argb[N], res[N];
    int i, j;

    printf ("testing atan2() with %d test vectors\n", N*M);

    for (j = 0; j < M; j++) {
        for (i = 0; i < N; i++) {
            arga[i] = rand_float();
            argb[i] = rand_float();
        }

        // This loop should be vectorized
        for (i = 0; i < N; i++) {
            res[i] = fast_atan2f (argb[i], arga[i]);
        }

        for (i = 0; i < N; i++) {
            ref = (float) atan2 ((double)argb[i], (double)arga[i]);
            relerr = (res[i] - ref) / ref;
            if ((fabsf (relerr) > maxrelerr) && 
                (fabsf (ref) >= powf (2.0f, -126))) { // result not denormal
                maxrelerr = fabsf (relerr);
            }
        }
    };

    printf ("max rel err = % 15.8e\n\n", maxrelerr);

    printf ("atan2(1,0)  = % 15.8e\n", fast_atan2f(1,0));
    printf ("atan2(-1,0) = % 15.8e\n", fast_atan2f(-1,0));
    printf ("atan2(0,1)  = % 15.8e\n", fast_atan2f(0,1));
    printf ("atan2(0,-1) = % 15.8e\n", fast_atan2f(0,-1));
    return EXIT_SUCCESS;
}

上面程序的输出应该类似于以下内容:

testing atan2() with 1000000000 test vectors
max rel err =  3.53486939e-005

atan2(1,0)  =  1.57079637e+000
atan2(-1,0) = -1.57079637e+000
atan2(0,1)  =  0.00000000e+000
atan2(0,-1) =  3.14159274e+000

关于sse - 在 x86(使用 SSE2)和 ARM(使用 vfpv4 NEON)上的尾数为 11 位的 atan2 近似值，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/46210708/

36

4

0

文章推荐： performance - 使用 Haskell 在功能上将数据集相互比较一次

文章推荐： sql - sql组合

文章推荐：组织模式下的 Emacs 有序列表

arm - ARM 系统模式与 arm 监控模式有何不同？
将 ARM 处理器模式与 x86 操作模式(ring0 到 ring 3)进行比较，用户模式看起来就像 ring3，用户空间程序在其中运行。但是，我无法将 ring0 与系统模式或主管模式联系起来。
arm - ARM 中临时寄存器的用例是什么？
为什么我们在 ARM 架构中有暂存寄存器？处理器如何使用它，我的意思是这个寄存器的用途是什么？最佳答案来自 Procedure Call Standard for the Arm Architec
arm - ARM 弱内存模型保证了哪些顺序
我了解弱内存模型和强内存模型的基本区别。但是没有确切的弱定义，它取决于体系结构(这里是 ARM)。我已经阅读了有关 ARM 信息中心的文档，但仍有很多内容不清楚。有人可以列出 - ARM 保证哪些内
arm - ARM 的代码分析器
我想在 arm 9 上分析我的代码，是否有任何分析器可以给我函数调用时间和每个函数占用的总周期？我更喜欢任何免费的分析器。我喜欢在 Linux 中使用 kcachegrind。最佳答案我不知道有什
arm - arm 处理器中的外部中止
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭 7 年前。 Improve this qu
arm - ARM 的启动过程是怎样的？
众所周知，对于X86架构:按下电源按钮后，机器开始执行0xFFFFFFF0处的代码，然后开始执行BIOS中的代码以进行硬件初始化。 BIOS 执行后，它使用引导加载程序将操作系统镜像加载到内存中。最后
arm - 为 Thumb OR Arm 编译的 ARM ELF 的脚本/工具谓词
我有 rootfs 和 klibc 文件系统。我正在创建 make 规则，而一些开发人员的编译器较旧，但没有联网。note1 我正在尝试验证所有文件都是使用 arm 仅当检测到某个版本的编译器时。我已
json - Azure ARM 模板 - 访问由一个 ARM 模板在另一个 ARM 模板中创建的资源 ID
在部署实际应用程序之前，我们使用 ARM 模板部署 Azure 资源，作为构建过程的一部分。到目前为止，我们所有的应用程序资源都自包含在资源组中。例如需要 SQL Server 和存储帐户的 Web
arm - ARM/THUMB 状态切换
为什么 ARM Controller 在发生异常时要从 THUMB 状态返回到 ARM 状态？最佳答案一种解释可能是 ARM 模式是 CPU 的“ native ”操作模式，与有限的 Thumb
arm - ARM NEON 内在函数中的反向向量顺序
我正在尝试反转 128 位向量 (uint16x8) 的顺序。例如，如果我有 a b c d e f g h 我想获得 h g f e d c b a 有没有一种简单的方法可以使用 NEON 内在函
arm - 单核 ARM 上的内存屏障
有很多关于内存屏障的信息。大多数信息是指多核或多处理器架构。 Stackoverflow 上的某个地方还指出，单核处理器不需要内存屏障。到目前为止，我找不到任何明确的解释，为什么单核 CPU 上不需
arm - 优化不同阵列的 ARM 缓存使用
我想在 ARM Cortex A8 处理器上移植一小段代码。 L1 缓存和 L2 缓存都非常有限。我的程序中有 3 个数组。其中两个是顺序访问的(大小> 数组 A:6MB 和数组 B:3MB)，第三个
arm - 对 ARM 指令感到困惑
我无法弄清楚这个 ARM 指令是做什么的: strd.w r0, r1, [r2] 我知道这是一个存储指令，它在 *r2 中存储了一些东西。但我不完全确定是什么。为什么有两个源寄存器
arm - 为什么有些 ARM 指令不使用桶形移位器？
我很好奇为什么有些 ARM 指令(如 MUL 和 ADD)不使用桶形移位器。我想知道极限背后的理性。谢谢! 最佳答案并不是没有使用桶形移位器；这是您无法指定它在非常具体的指令(数据处理和加载/存储)
arm - 平均操作 ARM NEON
我需要计算与 SSE 相同的操作: __m128i result1=_mm_avg_epu8 (upper, lower); 使用 NEON，我执行以下操作: uint8x16_t result1=v
arm - PLD在 ARM 皮层a9中的使用
我正在尝试使用 PLD 指令。我面临的问题如下: int32_t addr[10]; asm ("PLD [addr,#5]"); 我收到以下错误: Error: ARM register expec
arm - 显式访问 ARM 上的存储寄存器
根据 ARM 手册，应该可以访问特定 CPU 模式的存储寄存器，例如“r13_svc”。当我尝试执行此操作时，gcc 对我大喊大叫，并显示以下错误: 立即表达式需要 # 前缀 -- `mov r2,s
arm - 什么时候使用 .ARM.exidx
我正在使用 mbxxx 目标开发 Contiki 2.7。在构建我的代码时，链接器提示 .ARM.exidx 和 .data 部分的重叠 .在修改了链接器脚本 contiki-2.7/cpu/stm3
arm - 如何检查 ARM 上是否存在NEON？
如何确定给定 ARM 处理器上是否存在 NEON 引擎？可以为此目的查询任何状态/标志寄存器吗？最佳答案我相信unixsmurf's answer如果使用具有特权内核的操作系统，这将与您获得的一样
arm - 如何在 ARM 平台上分析裸机源代码？
如何在设备上分析我的 ARM 代码。这是涉及 USB 和 SDH 处理的裸机代码，我看到了这个 Code Profiler for ARM但似乎很 slim ，我很熟悉DS5但如果您使用基于 lin

首页

博学

6Ren·AI

商城

sse - 在 x86(使用 SSE2)和 ARM(使用 vfpv4 NEON)上的尾数为 11 位的 atan2 近似值