- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
考虑这个简单的代码:
#include <complex.h>
complex double f(complex double x, complex double y) {
return x/y;
}
在 gcc 7.1 中使用 -O3 -march=core-avx2 -ffast-math 你会得到:
f:
vmulsd xmm4, xmm1, xmm3
vmovapd xmm6, xmm0
vmulsd xmm5, xmm3, xmm3
vmulsd xmm6, xmm6, xmm3
vfmadd231sd xmm4, xmm0, xmm2
vfmadd231sd xmm5, xmm2, xmm2
vfmsub132sd xmm1, xmm6, xmm2
vdivsd xmm0, xmm4, xmm5
vdivsd xmm1, xmm1, xmm5
ret
这是有道理的,而且很容易理解。然而,英特尔 C 编译器给出:
f:
fld1 #3.12
vmovsd QWORD PTR [-24+rsp], xmm2 #3.12
fld QWORD PTR [-24+rsp] #3.12
vmovsd QWORD PTR [-24+rsp], xmm3 #3.12
fld st(0) #3.12
fmul st, st(1) #3.12
fld QWORD PTR [-24+rsp] #3.12
fld st(0) #3.12
fmul st, st(1) #3.12
vmovsd QWORD PTR [-24+rsp], xmm0 #3.12
faddp st(2), st #3.12
fxch st(1) #3.12
fdivp st(3), st #3.12
fld QWORD PTR [-24+rsp] #3.12
vmovsd QWORD PTR [-24+rsp], xmm1 #3.12
fld st(0) #3.12
fmul st, st(3) #3.12
fxch st(1) #3.12
fmul st, st(2) #3.12
fld QWORD PTR [-24+rsp] #3.12
fld st(0) #3.12
fmulp st(4), st #3.12
fxch st(3) #3.12
faddp st(2), st #3.12
fxch st(1) #3.12
fmul st, st(4) #3.12
fstp QWORD PTR [-16+rsp] #3.12
fxch st(2) #3.12
fmulp st(1), st #3.12
vmovsd xmm0, QWORD PTR [-16+rsp] #3.12
fsubrp st(1), st #3.12
fmulp st(1), st #3.12
fstp QWORD PTR [-16+rsp] #3.12
vmovsd xmm1, QWORD PTR [-16+rsp] #3.12
ret
Can anyone explain what it is doing and whether it is in fact faster than gcc's approach?
我无法自己对代码进行基准测试,因为我没有 ICC。 ICC 程序集是使用 https://godbolt.org/g/ZXZGy2 创建的.
最佳答案
根据问题和一些评论的要求,我运行了一个快速基准测试来比较 GCC 和 ICC 编译器在这段 C 代码上的性能。
硬件设置
用于运行测试的机器配备AMD A8-5550M APU四核处理器,频率为2.1 GHz。 L1i 的缓存大小为 16k,L1d 的缓存大小为 64k,L2 的缓存大小为 2048K。
实验设置
我没有 ICC 编译器的副本,因此问题中列出的汇编代码直接用于此基准测试。两个汇编输出是使用 NASM 汇编器编译的。为了使 ICC 版本兼容,需要进行一些小的语法更改,但当然不会以任何方式更改功能或影响性能。编写了一个小型 C 包装器来调用两个汇编函数并监视计时。
下面是与此简单基准测试中使用的代码类似的代码版本:
#include <stdio.h>
#include <complex.h>
#include <time.h>
extern complex double gcc_f(complex double x, complex double y);
extern complex double icc_f(complex double x, complex double y);
int main() {
struct timespec stop, start;
complex double z1 = 1.0654575 + 3.0678788768 * I;
complex double z2 = 2.225 - 8.0 * I;
clock_gettime(CLOCK_MONOTONIC_RAW, &start);
for(int i =0; i < 1000000000; ++i) {
icc_f(z1, z2);
// gcc_f(z1, z2);
}
clock_gettime(CLOCK_MONOTONIC_RAW, &stop);
printf("Execution took %luns\n", ((stop.tv_sec - start.tv_sec) * 1000000000 + (stop.tv_nsec - start.tv_nsec)));
return 0;
}
结果
这两个时间都是十亿次执行的平均值。
GCC 版本每次执行平均需要 8.8ns。
ICC 版本每次执行平均花费17.3ns。
因此,GCC 编译器的性能明显优于 ICC 编译器,至少在上述特定硬件设置下是如此。在这种情况下,GCC 似乎更巧妙地利用了 AVX 指令集。
<小时/>顺便说一句,非常有趣的是,如果您使用 -Ofast
而不是 -O3
进行编译,ICC 版本看起来与 GCC 版本更相似:
f:
vunpcklpd xmm4, xmm2, xmm3 #2.54
vunpcklpd xmm6, xmm0, xmm1 #2.54
vunpckhpd xmm5, xmm4, xmm4 #3.12
vmulpd xmm10, xmm4, xmm4 #3.12
vmulpd xmm8, xmm5, xmm6 #3.12
vmovddup xmm9, xmm4 #3.12
vshufpd xmm7, xmm6, xmm6, 1 #3.12
vshufpd xmm11, xmm10, xmm10, 1 #3.12
vfmaddsub213pd xmm9, xmm7, xmm8 #3.12
vaddpd xmm13, xmm10, xmm11 #3.12
vshufpd xmm12, xmm9, xmm9, 1 #3.12
vdivpd xmm0, xmm12, xmm13 #3.12
vunpckhpd xmm1, xmm0, xmm0 #3.12
ret
这个替代的 ICC 版本明显更快,每次执行平均 9.0ns,但仍略落后于 GCC 版本。然而,如此小的差异可能与实验设置有关。
关于gcc - gcc 与 ICC 中最快的复杂除法,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/44627023/
我正在尝试在 Conda 环境中编译一些代码,在那里我 之前安装的编译包gcc_linux-64 . 然而,即使在停用和重新激活环境之后,gcc还在/usr/bin/gcc . 我该怎么做才能让 Co
关闭。这个问题是opinion-based .它目前不接受答案。 想要改进这个问题? 更新问题,以便 editing this post 可以用事实和引用来回答它. 关闭 7 年前。 Improve
这其实是两个问题: 1 - 在我的 debian amd64 系统上,我似乎无法构建与 gmp/mpfr/mpc 动态链接的交叉 GCC。即使我删除 --disable-shared,它也总是静态链接
研究ELF格式的结果,可以看到目标文件中有一个符号对应每个函数,对应的符号表项的值为st_size,表示大小的功能。 问题是,即使我更改了目标文件中特定函数的 st_size 并链接了它,但可执行文件
海湾合作委员会的 documentation for #line directives说他们是这样的: #line "myfile.cpp" 123 但是当我用 g++ 5.1 检查输出时,它们实际上
我正在使用 as 和 gcc 来汇编和创建 ARM 汇编程序的可执行文件,正如 this 所推荐的那样教程,如下: 给定一个汇编源文件,program.s,我运行: as -o program.o p
long long x; double n; x=long long(n); 这不起作用。什么是正确的方法? 最佳答案 显而易见的: x = (long long) n; 关于gcc - 转换为长长
我想知道用于 gcc 的原子内置函数的头文件是什么? 我想使用这 2 个函数为我当前创建的线程库实现互斥锁。 bool __sync_bool_compare_and_swap (type *ptr,
它出现在 another question :gcc调用的程序和部件是什么? (特别是在编译 C 或 C++ 时)以便有人可以设计一些拦截和更改流程的方案以用于各种自定义编码目的? 最佳答案 编译器二
可能吗?我想使用 gcc喜欢 assembler并在将其编译为 ubuntu 上的可执行文件后。 我尝试过这个: gcc a.asm -o out.o 来自 out.o文件编译成.out可执行文件。
我写了一个简单的 C 程序 test.c : #include #include int add(int a, int b); int main() { int i=5,j=10;
即。所以如果你使用任何八进制文字,它会给你一个警告。 微软编译器的同样问题。 如果没有,是否有任何其他工具可以检测八进制文字。 (vim 似乎有一个很酷的技巧,它突出了第一个领先的将不同的颜色归零,但
我在旧线程中搜索。但没有找到任何线程回答我的问题。 gcc 是否像 vc++ 一样支持函数级链接? 如果是,我应该提供什么选项来链接目标文件和库? 最佳答案 看起来 gcc 不直接支持函数级链接。您可
也许标题并没有把问题说得那么准确:我知道当我运行 gcc foo.c 时,GCC 会调用其他为它完成所有工作的子程序,从而生成主 gcc 程序只是一个界面。但这究竟是如何完成的呢? 它是否使用syst
我听说最近版本的 gcc 非常擅长将通过函数指针的调用转换为直接调用。但是,我在网上或快速浏览 gcc 的源代码上找不到任何关于它的信息。有谁知道这是否真的是真的,如果是这样,它使用什么算法来做到这一
gcc/g++ 链接器选项“-Map”生成的“.map”文件用于什么? 以及如何阅读它们? 最佳答案 我建议为您投入生产的任何软件生成一个映射文件并保留一份副本。 它可用于破译崩溃报告。根据系统的不同
gcc信息文件在有关x86-64特定标志的部分中说 其他事情: There is no `-march=generic' option because `-march' ind
我想知道 gcc 链接器选项(例如:-Wl,options)是否可以更改编译后的可执行文件中的汇编指令,因为如果您使用某些 gcc 优化选项会发生这种情况? 当您比较编译后的二进制文件(例如比较签名)
是否有GCC编译指示会停止,暂停或中止编译过程? 我正在使用gcc 4.1,但也希望在gcc 3.x版本上也可以使用该编译指示。 最佳答案 您可能需要#error: edd@ron:/tmp$ g++
当我使用gcc编译C程序时我通常使用 -g 将一些调试信息放入 elf 文件中这样 gdb 就可以在需要时帮助我。 但是,我注意到有些程序使用 -ggdb,因为它应该使调试信息对 gdb 更加友好。
我是一名优秀的程序员,十分优秀!