- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
背景:我开发了一个计算密集型工具,用 C/C++ 编写,必须能够在各种不同的 x86_64 处理器上运行。为了加速 float 和整数的计算,代码包含相当多的 SSE* 内在函数,这些函数具有针对不同 CPU SSE 功能量身定制的不同路径。 (由于 CPU 标志在程序开始时被检测到并用于设置 bool 值,我假设定制代码块的分支预测将非常有效地工作)。
为简单起见,我假设只需要考虑 SSE2 到 SSE4.2。
为了访问 SSE4.2 intrinsics fpr 4.2 路径,我需要使用 gcc 的 -msse4.2 选项。
问题我遇到的问题是,至少在 6.1.0 中,gcc 会使用 sse4.2 指令 pinsrd 来实现 sse2 内部函数 mm_cvtsi32_si128。
如果我使用-msse2 限制编译,它将使用sse2 指令,movd,即。英特尔“内在指南”说它应该使用的那个。
这在两个方面很烦人。
1) 关键问题是程序现在在 pre4.2 CPU 上运行时因非法指令而崩溃。我无法控制所使用的硬件,因此可执行文件需要与旧机器兼容,但需要在可用的情况下利用较新硬件的功能。
2) 根据 Intel intrinsics guide,pinrd 指令比它替换的 mov 指令慢很多。 (pinsrd 更通用,但这不是必需的)。
有谁知道如何让 gcc 只是使用内在函数指南说应该使用的指令,但仍然允许在同一编译单元中访问所有 SSE2 到 SSE4*?
更新:我还应该注意,相同的代码是在 Linux、Windows 和 OSX 下使用各种不同的编译器编译的,因此如果可能,我宁愿避免或至少使用最少的特定于编译器的扩展。
更新 2:(感谢@PeterCordes)似乎如果启用了优化,gcc 将在适当的时候恢复使用来自 pinsrd 的 movd。
最佳答案
如果您在编译步骤中将 -msse4.2
标志提供给 gcc 的命令行,它将假定它可以免费使用整个翻译单元的 SSE 4.2 指令集。这可能会导致您描述的行为。如果您需要仅使用 SSE2 及以下代码的代码,则需要使用 -msse2
(如果您正在为 x86_64 构建,则根本不使用标志)。
我能想到的一些选项是:
如果您可以轻松地在函数级别分解您的代码,那么 gcc 的 multiversioning功能可以提供帮助。它需要相对较新版本的编译器,但它允许您执行如下操作(取自上面的链接):
__attribute__ ((target ("default")))
int foo ()
{
// The default version of foo.
return 0;
}
__attribute__ ((target ("sse4.2")))
int foo ()
{
// foo version for SSE4.2
return 1;
}
__attribute__ ((target ("arch=atom")))
int foo ()
{
// foo version for the Intel ATOM processor
return 2;
}
__attribute__ ((target ("arch=amdfam10")))
int foo ()
{
// foo version for the AMD Family 0x10 processors.
return 3;
}
int main ()
{
int (*p)() = &foo;
assert ((*p) () == foo ());
return 0;
}
在此示例中,gcc 将自动编译不同版本的 foo()
并在运行时根据 CPU 的能力分派(dispatch)到适当的版本。
您可以将不同的实现(SSE2、SSE4.2 等)分解为不同的翻译单元,然后在运行时适本地分派(dispatch)到正确的实现。
您可以将所有 SIMD 代码放入共享库中,并使用不同的编译器标志多次构建共享库。然后在运行时,您可以检测 CPU 的能力并加载适当版本的共享库。这是像 Intel's Math Kernel Library 这样的图书馆所采用的方法。 .
关于c - gcc (6.1.0) 在 SSE 内在函数中使用 'wrong' 指令,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/40661659/
我正在尝试在 Conda 环境中编译一些代码,在那里我 之前安装的编译包gcc_linux-64 . 然而,即使在停用和重新激活环境之后,gcc还在/usr/bin/gcc . 我该怎么做才能让 Co
关闭。这个问题是opinion-based .它目前不接受答案。 想要改进这个问题? 更新问题,以便 editing this post 可以用事实和引用来回答它. 关闭 7 年前。 Improve
这其实是两个问题: 1 - 在我的 debian amd64 系统上,我似乎无法构建与 gmp/mpfr/mpc 动态链接的交叉 GCC。即使我删除 --disable-shared,它也总是静态链接
研究ELF格式的结果,可以看到目标文件中有一个符号对应每个函数,对应的符号表项的值为st_size,表示大小的功能。 问题是,即使我更改了目标文件中特定函数的 st_size 并链接了它,但可执行文件
海湾合作委员会的 documentation for #line directives说他们是这样的: #line "myfile.cpp" 123 但是当我用 g++ 5.1 检查输出时,它们实际上
我正在使用 as 和 gcc 来汇编和创建 ARM 汇编程序的可执行文件,正如 this 所推荐的那样教程,如下: 给定一个汇编源文件,program.s,我运行: as -o program.o p
long long x; double n; x=long long(n); 这不起作用。什么是正确的方法? 最佳答案 显而易见的: x = (long long) n; 关于gcc - 转换为长长
我想知道用于 gcc 的原子内置函数的头文件是什么? 我想使用这 2 个函数为我当前创建的线程库实现互斥锁。 bool __sync_bool_compare_and_swap (type *ptr,
它出现在 another question :gcc调用的程序和部件是什么? (特别是在编译 C 或 C++ 时)以便有人可以设计一些拦截和更改流程的方案以用于各种自定义编码目的? 最佳答案 编译器二
可能吗?我想使用 gcc喜欢 assembler并在将其编译为 ubuntu 上的可执行文件后。 我尝试过这个: gcc a.asm -o out.o 来自 out.o文件编译成.out可执行文件。
我写了一个简单的 C 程序 test.c : #include #include int add(int a, int b); int main() { int i=5,j=10;
即。所以如果你使用任何八进制文字,它会给你一个警告。 微软编译器的同样问题。 如果没有,是否有任何其他工具可以检测八进制文字。 (vim 似乎有一个很酷的技巧,它突出了第一个领先的将不同的颜色归零,但
我在旧线程中搜索。但没有找到任何线程回答我的问题。 gcc 是否像 vc++ 一样支持函数级链接? 如果是,我应该提供什么选项来链接目标文件和库? 最佳答案 看起来 gcc 不直接支持函数级链接。您可
也许标题并没有把问题说得那么准确:我知道当我运行 gcc foo.c 时,GCC 会调用其他为它完成所有工作的子程序,从而生成主 gcc 程序只是一个界面。但这究竟是如何完成的呢? 它是否使用syst
我听说最近版本的 gcc 非常擅长将通过函数指针的调用转换为直接调用。但是,我在网上或快速浏览 gcc 的源代码上找不到任何关于它的信息。有谁知道这是否真的是真的,如果是这样,它使用什么算法来做到这一
gcc/g++ 链接器选项“-Map”生成的“.map”文件用于什么? 以及如何阅读它们? 最佳答案 我建议为您投入生产的任何软件生成一个映射文件并保留一份副本。 它可用于破译崩溃报告。根据系统的不同
gcc信息文件在有关x86-64特定标志的部分中说 其他事情: There is no `-march=generic' option because `-march' ind
我想知道 gcc 链接器选项(例如:-Wl,options)是否可以更改编译后的可执行文件中的汇编指令,因为如果您使用某些 gcc 优化选项会发生这种情况? 当您比较编译后的二进制文件(例如比较签名)
是否有GCC编译指示会停止,暂停或中止编译过程? 我正在使用gcc 4.1,但也希望在gcc 3.x版本上也可以使用该编译指示。 最佳答案 您可能需要#error: edd@ron:/tmp$ g++
当我使用gcc编译C程序时我通常使用 -g 将一些调试信息放入 elf 文件中这样 gdb 就可以在需要时帮助我。 但是,我注意到有些程序使用 -ggdb,因为它应该使调试信息对 gdb 更加友好。
我是一名优秀的程序员,十分优秀!