c++ - clang 的 `-Ofast` 选项在实际中有什么作用，特别是对于与 gcc 的任何差异？-6ren

c++ - clang 的 `-Ofast` 选项在实际中有什么作用，特别是对于与 gcc 的任何差异？

转载作者：可可西里更新时间：2023-11-01 16:32:10

27

4

类似于的SO问题What does gcc's ffast-math actually do? 并且与 Clang optimization levels 的 SO 问题相关，我想知道什么 clang的 -Ofast优化在实际方面的作用，这些是否与 gcc 完全不同，或者这是否比编译器更依赖于硬件。

根据 clang 优化级别的公认答案，-Ofast添加到 -O3优化:-fno-signed-zeros -freciprocal-math -ffp-contract=fast -menable-unsafe-fp-math -menable-no-nans -menable-no-infs .这似乎完全与 float 学相关。但是这些优化对于像 C++ Common mathematical functions 这样的事物在实践中意味着什么？对于 Intel Core i7 等 CPU 上的 float ，这些差异的可靠性如何？

例如，在实际方面:

代码std::isnan(std::numeric_limits<float>::infinity() * 0)为我返回 true -O3 .我相信这是符合 IEEE 数学标准的结果。

与 -Ofast但是，我得到了一个 false 返回值。此外，操作 (std::numeric_limits<float>::infinity() * 0) == 0.0f返回 true。

我不知道这是否与在 gcc 中看到的相同。我不清楚结果是如何依赖于架构的，也不清楚它们是如何依赖编译器的，也不清楚是否有适用于 -Ofast 的标准。 .

如果有人制作了类似一组 unit tests 的东西或 code koans这回答了这个问题，这可能是理想的。我已经开始做这样的事情，但不想重新发明轮子。

最佳答案

描述这些标志中的每一个如何影响每个数学函数需要太多的工作，我将尝试为每个标志提供一个示例。
留给你的负担是看看每一个如何影响一个给定的功能。

`-fno-signed-zeros`

假设您的代码不依赖于零的符号。
在 FP 算术零不是 absorbing element w.r.t.乘法:0 · x = x · 0 ≠ 0，因为零有一个符号，因此，例如 -3 · 0 = -0 ≠ 0(其中 0 通常表示 +0)。

您可以看到这个 live on Godbolt，其中仅使用 -Ofast

将乘以零展开为常数零

float f(float a)
{
    return a*0;
}

;With -Ofast
f(float):                                  # @f(float)
        xorps   xmm0, xmm0
        ret

;With -O3
f(float): # @f(float)
  xorps xmm1, xmm1
  mulss xmm0, xmm1
  ret

A EOF noted in the comments 这也取决于有限算术。

`-freciprocal-math`

使用倒数代替除数:a/b = a · (1/b)。
由于FP精度有限，等号真的没有。
乘法比除法快，见 Fog's tables 。
另请参阅 why-is-freciprocal-math-unsafe-in-gcc?。

Godbolt 上的实例:

float f(float a){
    return a/3;
}

;With -Ofast
.LCPI0_0:
        .long   1051372203              # float 0.333333343
f(float):                                  # @f(float)
        mulss   xmm0, dword ptr [rip + .LCPI0_0]
        ret

;With -O3
.LCPI0_0:
  .long 1077936128 # float 3
f(float): # @f(float)
  divss xmm0, dword ptr [rip + .LCPI0_0]
  ret

`-ffp-contract=fast`

启用 FP 表达式的收缩。
收缩是您可以在 field ℝ 中应用的任何法则的总称，它会产生简化的表达式。
例如，a * k/k = a。

但是，带有+和·的FP数集由于精度有限，一般不是一个域。
此标志允许编译器以正确性为代价收缩 FP 表达式。

Godbolt 上的实例:

float f(float a){
    return a/3*3;
}

;With -Ofast 
f(float):                                  # @f(float)
        ret

;With -O3
.LCPI0_0:
  .long 1077936128 # float 3
f(float): # @f(float)
  movss xmm1, dword ptr [rip + .LCPI0_0] # xmm1 = mem[0],zero,zero,zero
  divss xmm0, xmm1
  mulss xmm0, xmm1
  ret

`-menable-unsafe-fp-math`

有点上述，但在更广泛的意义上。

Enable optimizations that make unsafe assumptions about IEEE math (e.g. that addition is associative) or may not work for all input ranges. These optimizations allow the code generator to make use of some instructions which would otherwise not be usable (such as fsin on X86).

关于fsin指令的误差精度见this。

Godbolt 的实例，其中 a⁴ 被扩展为 (a^2/sup>)2:

float f(float a){
    return a*a*a*a;
}

f(float):                                  # @f(float)
        mulss   xmm0, xmm0
        mulss   xmm0, xmm0
        ret

f(float): # @f(float)
  movaps xmm1, xmm0
  mulss xmm1, xmm1
  mulss xmm1, xmm0
  mulss xmm1, xmm0
  movaps xmm0, xmm1
  ret

`-menable-no-nans`

假设代码不生成 NaN 值。
在 previous answer of mine 中，我分析了 ICC 如何通过假设没有 NaN 来处理复数乘法。

大多数 FP 指令会自动处理 NaN。
不过也有异常(exception)，例如 comparisons ，这可以在 Godbolt 的直播中看到

bool f(float a, float b){
    return a<b;
}

;With -Ofast
f(float, float):                                 # @f(float, float)
        ucomiss xmm0, xmm1
        setb    al
        ret

;With -O3
f(float, float): # @f(float, float)
  ucomiss xmm1, xmm0
  seta al
  ret

请注意，这两个版本并不等同，因为 -O3 一个版本排除了 a 和 b 无序的情况，而另一个版本将其包含在 中真 结果。
虽然在这种情况下性能相同，但在复杂的表达式中，这种不对称会导致不同的展开/优化。

`-menable-no-infs`

就像上面的一样，但对于无穷大。

我无法在 Godbolt 中重现一个简单的例子，但三角函数需要小心处理无穷大，尤其是对于复数。

如果您浏览 a glibc implementation's math dir(例如 sinc)，您会看到很多在使用 -Ofast 进行编译时应该省略的检查。

关于c++ - clang 的 `-Ofast` 选项在实际中有什么作用，特别是对于与 gcc 的任何差异？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/45685487/

27

4

0

文章推荐： node.js - 如何使用 Express API 发送 10x 响应？

文章推荐： java - 为什么我的简单 Jetty 服务器一次只处理 1 个请求？

文章推荐： java - 将 Apache Spark 添加到 Eclipse Maven 项目时出现问题

gcc - Conda gcc 不会取代系统 gcc
我正在尝试在 Conda 环境中编译一些代码，在那里我之前安装的编译包gcc_linux-64 . 然而，即使在停用和重新激活环境之后，gcc还在/usr/bin/gcc . 我该怎么做才能让 Co
python - GCC 插件、GCC Melt 或 gcc Python 插件来编写 gcc 扩展
关闭。这个问题是opinion-based .它目前不接受答案。想要改进这个问题？更新问题，以便 editing this post 可以用事实和引用来回答它. 关闭 7 年前。 Improve
gcc - 动态链接 gcc
这其实是两个问题: 1 - 在我的 debian amd64 系统上，我似乎无法构建与 gmp/mpfr/mpc 动态链接的交叉 GCC。即使我删除 --disable-shared，它也总是静态链接
gcc - gcc 链接器如何获取函数的大小？
研究ELF格式的结果，可以看到目标文件中有一个符号对应每个函数，对应的符号表项的值为st_size，表示大小的功能。问题是，即使我更改了目标文件中特定函数的 st_size 并链接了它，但可执行文件
gcc - GCC 风格行指令的格式
海湾合作委员会的 documentation for #line directives说他们是这样的: #line "myfile.cpp" 123 但是当我用 g++ 5.1 检查输出时，它们实际上
gcc - as + gcc vs gcc 仅用于 ARM 汇编
我正在使用 as 和 gcc 来汇编和创建 ARM 汇编程序的可执行文件，正如 this 所推荐的那样教程，如下: 给定一个汇编源文件，program.s，我运行: as -o program.o p
gcc - 转换为长长 (GCC)
long long x; double n; x=long long(n); 这不起作用。什么是正确的方法？最佳答案显而易见的: x = (long long) n; 关于gcc - 转换为长长
gcc - gcc 原子内置函数的头文件
我想知道用于 gcc 的原子内置函数的头文件是什么？我想使用这 2 个函数为我当前创建的线程库实现互斥锁。 bool __sync_bool_compare_and_swap (type *ptr,
gcc - GCC 的通行证和调用的程序是什么？
它出现在 another question :gcc调用的程序和部件是什么？ (特别是在编译 C 或 C++ 时)以便有人可以设计一些拦截和更改流程的方案以用于各种自定义编码目的？最佳答案编译器二
gcc - 如何像汇编程序一样使用 gcc？
可能吗？我想使用 gcc喜欢 assembler并在将其编译为 ubuntu 上的可执行文件后。我尝试过这个: gcc a.asm -o out.o 来自 out.o文件编译成.out可执行文件。
gcc - gcc 程序集输出标签是什么意思？
我写了一个简单的 C 程序 test.c : #include #include int add(int a, int b); int main() { int i=5,j=10;
gcc - gcc 中是否有针对八进制文字的警告？
即。所以如果你使用任何八进制文字，它会给你一个警告。微软编译器的同样问题。如果没有，是否有任何其他工具可以检测八进制文字。 (vim 似乎有一个很酷的技巧，它突出了第一个领先的将不同的颜色归零，但
gcc - gcc 中的函数级链接
我在旧线程中搜索。但没有找到任何线程回答我的问题。 gcc 是否像 vc++ 一样支持函数级链接？如果是，我应该提供什么选项来链接目标文件和库？最佳答案看起来 gcc 不直接支持函数级链接。您可
gcc - GCC 如何运行它的其他程序？
也许标题并没有把问题说得那么准确:我知道当我运行 gcc foo.c 时，GCC 会调用其他为它完成所有工作的子程序，从而生成主 gcc 程序只是一个界面。但这究竟是如何完成的呢？它是否使用syst
gcc - gcc 使用什么算法将通过函数指针的调用转换为直接调用？
我听说最近版本的 gcc 非常擅长将通过函数指针的调用转换为直接调用。但是，我在网上或快速浏览 gcc 的源代码上找不到任何关于它的信息。有谁知道这是否真的是真的，如果是这样，它使用什么算法来做到这一
gcc - gcc 链接器映射文件的用途是什么？
gcc/g++ 链接器选项“-Map”生成的“.map”文件用于什么？以及如何阅读它们？最佳答案我建议为您投入生产的任何软件生成一个映射文件并保留一份副本。它可用于破译崩溃报告。根据系统的不同
gcc - gcc -march选项的默认设置是什么？
gcc信息文件在有关x86-64特定标志的部分中说其他事情： There is no `-march=generic' option because `-march' ind
gcc - gcc 链接器选项可以更改已编译二进制文件中的汇编器指令吗？
我想知道 gcc 链接器选项(例如:-Wl,options)是否可以更改编译后的可执行文件中的汇编指令，因为如果您使用某些 gcc 优化选项会发生这种情况？当您比较编译后的二进制文件(例如比较签名)
gcc - GCC#pragma停止编译
是否有GCC编译指示会停止，暂停或中止编译过程？我正在使用gcc 4.1，但也希望在gcc 3.x版本上也可以使用该编译指示。最佳答案您可能需要#error: edd@ron:/tmp$ g++
gcc - gcc -ggdb 和 gcc -g 有什么区别
当我使用gcc编译C程序时我通常使用 -g 将一些调试信息放入 elf 文件中这样 gdb 就可以在需要时帮助我。但是，我注意到有些程序使用 -ggdb，因为它应该使调试信息对 gdb 更加友好。

首页

博学

6Ren·AI

商城