c++ - 编译器优化 : g++ slower than intel-6ren

c++ - 编译器优化 : g++ slower than intel

转载作者：IT老高更新时间：2023-10-28 22:24:27

25

4

我最近购买了一台双启动计算机，可以用 C++ 编写代码。在 Windows 上，我在 linux 上使用英特尔 C++ 编译器和 g++。
我的程序主要由计算组成(具有数值积分的定点迭代算法等)。
我以为我可以在我的 linux 上获得接近 windows 的性能，但到目前为止我还没有:对于完全相同的代码，使用 g++ 编译的程序比使用 intel 编译器的程序慢大约 2 倍。从我读到的内容来看，icc 可以更快，甚至可能提高 20-30%，但我没有读到任何关于它快两倍的内容(总的来说，我实际上读到两者应该是等效的)。

起初我使用的标志大致等效:

icl /openmp /I "C:\boost_1_61_0" /fast program.cpp

和

g++ -o program program.cpp -std=c++11 -fopenmp -O3 -ffast-math

遵循其他几个主题的建议，我尝试添加/替换其他几个标志，例如:-funsafe-math-optimizations、-march=native、-fwhole-program、-Ofast 等，但只有轻微(或没有)性能提升。

icc 真的更快还是我错过了什么？
我对 linux 相当陌生，所以我不知道，也许我忘记正确安装某些东西(例如驱动程序)，或者更改 g++ 中的某些选项？我不知道情况是否正常，所以我更愿意问。特别是因为我更喜欢使用 linux 进行理想的编码，所以我宁愿让它跟上速度。

编辑:我决定在 linux 上安装最后一个 intel 编译器(Intel Compiler C++ 17, update4)来检查。我最终得到了减轻的结果:它并不比 gcc 做得更好(实际上更糟)。
我运行交叉比较 linux/windows - icc/gcc - 是否并行，使用帖子前面提到的标志(进行直接比较)，这是我的结果(运行 1 次迭代的时间以毫秒为单位):

普通循环，无并行化:

视窗:
gcc = 122074 ； icc = 68799

Linux:
gcc = _91042; icc = 92102

并行版本:

视窗:
gcc = 27457； icc = 19800

Linux:
gcc = 27000 ; ICC = 30000

总结一下:有点乱。
在 linux 上，gcc 似乎总是比 icc 快，尤其是在涉及并行化时(我为更长的程序运行了它，差异比这里的高得多)。
在 Windows 上，情况正好相反，icc 显然支配了 gcc，尤其是在没有并行化的情况下(在这种情况下，gcc 需要很长时间来编译)。

最快的编译是通过 Windows 上的并行化和 icc 完成的。我不明白为什么我不能在 linux 上复制它。我需要做些什么(ubuntu 16.04)来帮助我加快流程？
另一个区别是，在 Windows 上我使用较旧的 intel composer ( Composer XE 2013 ) 并调用 'ia32' 而不是 intel64(这是我应该使用的)，而在 linux 上我使用最后一个版本我昨天安装的。在 linux 上，Intel Compiler 17 文件夹在我的第二个硬盘上(而不是我安装 linux 的 ssd)我不知道这是否也会减慢速度。
知道问题可能来自哪里吗？

编辑:确切的硬件:
Intel(R) Core(TM) i7-4710HQ CPU @ 2.50GHz，8 个 CPU，4 个内核，每个内核 2 个线程，架构 x86_64
- 带有 gcc 5.4.1 和 Intel Compiler 17 (update4) 的 Linux Ubuntu 16.04
- Windows 8.1，英特尔 Composer 2013

编辑:代码很长，这是我正在测试的循环形式(即我的定点迭代的一次迭代)。我想这是非常经典的……不确定它可以为主题带来什么。

// initialization of all the objects...
// length_grid1 is about 2000
vector< double > V_NEXT(length_grid1), PRICE_NEXT(length_grid1);
double V_min, price_min; 
#pragma omp parallel
{ 
#pragma omp for private(V_min, price_min, i, indexcurrent, alpha, beta)
    for (i = 0; i < length_grid1; i++) {
         indexcurrent = indexsum[i]; 
         V_min = V_compute(&price_min, indexcurrent, ...);
         V_NEXT[indexcurrent] = V_min; PRICE_NEXT[indexcurrent] = price_min;
     }
 }// end parallel

其中 V_compute 函数是一个经典而简单的优化算法(自定义黄金搜索)，返回最优值及其参数:

double V_compute(double *xmin, int row_index, ... ) {
double x1, x2, f1, f2, fxmin;
// golden_ratio=0.61803399; 
x1 = upper_bound - golden_ratio*(upper_bound - lower_bound);
x2 = lower_bound + golden_ratio*(upper_bound - lower_bound);

// Evaluate the function at the test points
f1 = intra_value(x1, row_index, ...);
f2 = intra_value(x2, row_index, ...);

while (fabs(upper_bound - lower_bound) > tolerance) {
    if (f2 > f1){
        upper_bound = x2; x2 = x1; f2 = f1;
        x1 = upper_bound - golden_ratio*(upper_bound - lower_bound);
        f1 = intra_value(x1, row_index, ...);
    } else {
        lower_bound = x1; x1 = x2; f1 = f2;
        x2 = lower_bound + golden_ratio*(upper_bound - lower_bound);
        f2 = intra_value(x2, row_index, ...);
    }
}
// Estimated minimizer = (lower bound + upper bound) / 2
*xmin = (lower_bound + upper_bound)/2;
fxmin = intra_value(*xmin, row_index, ...);
return - fxmin; }

优化的函数(intra_value)在计算方面相当复杂(从预编译的网格中选择一个网格点(row_index)，然后涉及大量的数值积分等)。

最佳答案

看起来您正在使用 OpenMP，所以我怀疑区别在于 OpenMP 实现，而不仅仅是优化代码的质量。

众所周知，英特尔的 OpenMP 运行时性能非常高，而 GCC 的性能很好但不是很好。

OpenMP 程序具有非常不同的性能特征，它们不仅仅取决于编译器优化循环或内联函数调用的能力。 OpenMP 运行时的实现以及线程和同步原语的操作系统实现非常重要，这在 Windows 和 GNU/Linux 之间有很大的不同。

关于c++ - 编译器优化 : g++ slower than intel，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/44370120/

25

4

0

文章推荐： Python Gensim : how to calculate document similarity using the LDA model?

文章推荐： android - 您上传的 APK 不是 zip 对齐错误

文章推荐： python - 从 ElasticSearch 结果创建 DataFrame

文章推荐： android - 从下到上逐渐填充一个圆圈android

intel-pin - intel pin工具中图像的含义
我是Intel pin工具的新手，最近开始研究pin工具。在教程中，描述了pin工具的模式: Sometimes, however, it can be useful to look at diffe
intel-pin - intel pin工具中图像的含义
我是Intel pin工具的新手，最近开始研究pin工具。在教程中，描述了pin工具的模式: Sometimes, however, it can be useful to look at diffe
intel - 如何开始使用库 intel ipp？
我得到了这份工作:1。产生一个正弦信号。2。使用 FFT 构建其频谱。首先，我为 visual studio 2010 安装了 Intel Parallel Studio XE 2011。在 vs 2
opencl - intel-compute-runtime、intel-opencl-runtime 和 intel-opencl-sdk 之间有什么区别？
看起来 Intel 提供了许多 OpenCL 实现。 ArchWiki描述 OpenCL 实现。它说 beignet 和 intel-opencl 已弃用。那么，intel-compute-runti
intel - 如何读取 "Intel Intrinsics Guide"？
我正在尝试通过阅读 Intel Intrinsics Guide 来开始使用 AVX512 内在函数但到目前为止我发现它没有定义命名数据类型或用于解释的伪代码语法。没有这样的定义，所谓的指南对我起码没
intel - AMD 与 Intel 处理器制作可执行文件
关闭。这个问题是opinion-based 。目前不接受答案。想要改进这个问题吗？更新问题，以便 editing this post 可以用事实和引文来回答它。 . 已关闭 4 年前。 Improv
android-studio - "Intel Atom Image"、 "Google APIs Intel Atom image"和 "Google play Intel Atom Image"之间有什么区别？
在 Android SDK 管理器中，我可以看到 3 种类型的 Intel Atom 图像。有人可以解释“Intel Atom Image”、“Google APIs Intel Atom Image
intel-pin - 使用 intel pintool 记录所有指令
我写了这个 pintool: #include "pin.H" #include #include VOID Instruction(INS ins, VOID *v) { cou
intel - 了解 Intel Intrinsics Guide 中的代码示例
我正在尝试了解 _mm256_permute2f128_ps() 的作用，但无法完全理解 intel's code-example . DEFINE SELECT4(src1, src2, contr
intel - 使用 Intel 内在函数 SSSE3 的替代方案时性能下降
我正在开发一个性能关键应用程序，该应用程序必须移植到仅支持 MMX、SSE、SSE2 和 SSE3 的英特尔凌动处理器中。我以前的应用程序支持 SSSE3 和 AVX，现在我想将其降级为 Intel
intel-pin - Intel Pin 3.0无法识别MPX指令？
我有最新版本的 Intel Pin 3.0 版本 76887。我有一个支持 MPX 的玩具示例: #include int g[10]; int main(int argc, char **arg
intel - 在 Intel 上使用 OpenSolaris 研究 SPARC 可执行结构
我想研究和比较elf、SPARC和PA-RISC的可执行文件结构。为了进行研究，我想在 Intel 机器 (Core2Duo) 上安装 OpenSolaris。但我有一个基本的疑问，它会起作用吗？
intel-mkl - 无法使用 g++ 将数学库与 intel mkl 链接
我尝试使用 g++ 用 intel mkl 11.1 进行编译: g++ -m32 test.c -lmkl_intel -lmkl_intel_thread -lmkl_core -liomp5 -
c++ - 我如何使用 intel 编译器和 intel mpi 安装 boost？
我正在按照以下说明进行操作: https://software.intel.com/en-us/articles/building-boost-with-intel-c-compiler-150 Co
c++ - -masm=intel 标志不适用于使用 Intel 语法在 gcc 编译器中运行汇编语言
我正在尝试在我的 C 程序中使用内联汇编程序 __asm，使用 Intel 语法而不是 AT&T 语法。我正在使用 gcc -S -masm=intel test.c 进行编译但它给出了错误。下面是我
c++ - Intel HD GPU 与 Intel CPU 性能比较
我是 OpenCL 的新手，目前对其性能有一些疑问。我有 Intel(R) Core(TM) i5-4460 CPU @ 3.20GHz + ubuntu + Beignet(Intel 开源 op
Makefile:Intel fortran，文件夹中的源文件，和 Intel Math Kernel Library
我在/ex 文件夹中有一个 main.f90。 f77 子程序文件在/ex/src 中。子程序文件再次使用 BLAS 和 LAPACK 库。对于 BLAS 和 LAPACK，我必须使用英特尔数学核心函
c++ - 为什么此代码链接到 Intel Compiler 2015 而不是 Intel Compiler 2018？
我的团队最近从 2015 年英特尔编译器(并行工作室)升级到 2018 年版本，我们遇到了一个链接器问题，让每个人都焦头烂额。我有以下类(为简洁起见进行了适度编辑)，用于处理子进程的包装以及与它们对
intel - 为什么 Intel Haswell XEON CPU 偶尔会错误计算 FFT 和 ART？
在最后几天，我观察到我无法解释的新工作站的行为。对这个问题做一些研究，INTEL Haswell architecture 中可能存在一个可能的错误。以及在当前的 Skylake Generation
android-emulator - Intel HAXM 安装错误 - 此计算机不支持 Intel 虚拟化技术 (VT-x)
我的 HAXM 安装存在问题。事情是这样的。每次尝试为我的计算机安装 HAXM 时，我都会收到此错误: 问题是，我的计算机支持虚拟化技术(见下图)。知道如何解决这个问题吗？最佳答案只需执行以下步骤

首页

博学

6Ren·AI

商城

c++ - 编译器优化 : g++ slower than intel