gcc - 在内联汇编中使用特定的 zmm 寄存器-6ren

gcc - 在内联汇编中使用特定的 zmm 寄存器

转载作者：行者123 更新时间：2023-12-03 08:59:31

36

4

我可以告诉gcc-style inline assembly把我的__m512i变量到特定 zmm注册，如 zmm31 ？

最佳答案

就像在根本没有特定寄存器约束的目标(如 ARM)上一样，使用 local register variables获得广泛的约束来为 asm 语句选择特定的寄存器。编译器仍然可以以其他方式进行优化，因为寄存器本地的唯一有记录的保证效果是针对asm输入/输出。

即使没有 asm，编译器也会优先指定的寄存器。 (因此，您可以使用诸如 register int ebx asm("ebx"); return ebx; 之类的内容编写看似有效但一般不安全的代码。GCC 文档是保证行为的原因/面向 future ，即使当前的 gcc 更喜欢使用指定的寄存器，当约束与指定的寄存器不兼容时，足以浪费指令，请参见下文。)

无论如何，register-asm 本地变量的使用是它们保证起作用的唯一事情:

#include <immintrin.h>
__m512i foo() {
    register __m512i z31 asm("zmm31") = _mm512_set1_epi32(123);
    register __m512i z30 asm("zmm30");

    asm("vmovdqa64 %1, %0  # from inline asm"
        : "=v"(z30)
        : "v"(z31)
       );
    return z30;
}

关于the Godbolt compiler explorer ，使用 clang6.0 编译为:

    # clang -O3 -march=skylake-avx512
    vbroadcastss    .LCPI0_0(%rip), %zmm31 # zmm31 = [1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43,1.72359711E-43]
    vmovdqa64       %zmm31, %zmm30        # from inline asm
    vmovaps %zmm30, %zmm0
    retq

和gcc8.2:

# gcc -O3 -march=skylake-avx512
foo():
    movl    $123, %eax
    vpbroadcastd    %eax, %zmm31
    vmovdqa64 %zmm31, %zmm30  # from inline asm
    vmovdqa64       %zmm30, %zmm0
    ret

注意"v"约束，它允许任何EVEX向量寄存器(0..31)，与"x"不同，它只允许第一个 16. "x" 被记录为“任何 SSE 寄存器”，但也适用于 AVX YMM 寄存器。 https://gcc.gnu.org/onlinedocs/gcc/Machine-Constraints.html .

使用 "x" 不会导致任何警告，但使用 gcc "x" 会胜过寄存器变量声明，因此它选择了 % zmm2 和 %zmm1 (奇怪的是不是 zmm0 所以需要额外的移动)。因此，register-asm 声明确实降低了我们的效率。

使用 clang 时，它仍然使用 zmm31 和 zmm30，显然违反了 "x" 约束，因此如果您在 XMM 或 YMM 上使用没有 EVEX 版本的指令，它将无法汇编寄存器操作数的一部分，如 AVX2 vpcmpeqd ymm,ymm,ymm (与向量比较，而不是与掩码比较)。 (In GNU C inline asm, what're the modifiers for xmm/ymm/zmm for a single operand?)。

//#ifndef __clang__
__m512i broken_with_clang() {
    register __m512i z31 asm("zmm31") = _mm512_set1_epi32(123);
    register __m512i z30 asm("zmm30") = _mm512_setzero_si512();
    // notice that gcc still inits these in zmm31 and 30, *then* copies
    // so register asm costs us efficiency.

    // AVX512 only has compares into k registers, not into YMM registers.
    asm("vpcmpeqd %t1, %t0, %t0  # from inline asm. input was %0"
        : "+x"(z30)
        : "x"(z31)
       );
    return z30;
}
//#endif

使用 clang，我们会得到每个操作数的错误；我猜 clang 不支持 t 修饰符来获取寄存器的 YMM 名称(因为即使我删除 register ... asm()，clang6.0 也会失败) > 完全是东西。)

<source>:21:9: error: invalid operand in inline asm: 'vpcmpeqd ${1:t}, ${0:t}, ${0:t}  # from inline asm. input was $0'
    asm("vpcmpeqd %t1, %t0, %t0  # from inline asm. input was %0"
        ^
...
<source>:21:9: error: unknown token in expression
<inline asm>:1:11: note: instantiated into assembly here
        vpcmpeqd , ,   # from inline asm. input was %zmm30

但是 gcc 编译得很好:

broken_with_clang():
    movl    $123, %eax
    vpbroadcastd    %eax, %zmm31
    vpxord  %xmm30, %xmm30, %xmm30

    vmovdqa64       %zmm30, %zmm1    # extra overhead because of register asm
    vmovdqa64       %zmm31, %zmm2    # which didn't match the constraints

    vpcmpeqd %ymm2, %ymm1, %ymm1  # from inline asm. input was %zmm1

    vmovdqa64       %zmm1, %zmm0     # extra overhead because gcc didn't pick zmm0
    ret

关于gcc - 在内联汇编中使用特定的 zmm 寄存器，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/52014436/

36

4

0

文章推荐： microsoft-graph-api - 如何使用 Microsoft.Graph 更新联系人？

文章推荐： php - Laravel Eloquent 嵌套组的关系

文章推荐： architecture - 前端还是后端调用微服务？

文章推荐： sql-server - SQL 始终加密与 SQL 动态数据屏蔽

gcc - Conda gcc 不会取代系统 gcc
我正在尝试在 Conda 环境中编译一些代码，在那里我之前安装的编译包gcc_linux-64 . 然而，即使在停用和重新激活环境之后，gcc还在/usr/bin/gcc . 我该怎么做才能让 Co
python - GCC 插件、GCC Melt 或 gcc Python 插件来编写 gcc 扩展
关闭。这个问题是opinion-based .它目前不接受答案。想要改进这个问题？更新问题，以便 editing this post 可以用事实和引用来回答它. 关闭 7 年前。 Improve
gcc - 动态链接 gcc
这其实是两个问题: 1 - 在我的 debian amd64 系统上，我似乎无法构建与 gmp/mpfr/mpc 动态链接的交叉 GCC。即使我删除 --disable-shared，它也总是静态链接
gcc - gcc 链接器如何获取函数的大小？
研究ELF格式的结果，可以看到目标文件中有一个符号对应每个函数，对应的符号表项的值为st_size，表示大小的功能。问题是，即使我更改了目标文件中特定函数的 st_size 并链接了它，但可执行文件
gcc - GCC 风格行指令的格式
海湾合作委员会的 documentation for #line directives说他们是这样的: #line "myfile.cpp" 123 但是当我用 g++ 5.1 检查输出时，它们实际上
gcc - as + gcc vs gcc 仅用于 ARM 汇编
我正在使用 as 和 gcc 来汇编和创建 ARM 汇编程序的可执行文件，正如 this 所推荐的那样教程，如下: 给定一个汇编源文件，program.s，我运行: as -o program.o p
gcc - 转换为长长 (GCC)
long long x; double n; x=long long(n); 这不起作用。什么是正确的方法？最佳答案显而易见的: x = (long long) n; 关于gcc - 转换为长长
gcc - gcc 原子内置函数的头文件
我想知道用于 gcc 的原子内置函数的头文件是什么？我想使用这 2 个函数为我当前创建的线程库实现互斥锁。 bool __sync_bool_compare_and_swap (type *ptr,
gcc - GCC 的通行证和调用的程序是什么？
它出现在 another question :gcc调用的程序和部件是什么？ (特别是在编译 C 或 C++ 时)以便有人可以设计一些拦截和更改流程的方案以用于各种自定义编码目的？最佳答案编译器二
gcc - 如何像汇编程序一样使用 gcc？
可能吗？我想使用 gcc喜欢 assembler并在将其编译为 ubuntu 上的可执行文件后。我尝试过这个: gcc a.asm -o out.o 来自 out.o文件编译成.out可执行文件。
gcc - gcc 程序集输出标签是什么意思？
我写了一个简单的 C 程序 test.c : #include #include int add(int a, int b); int main() { int i=5,j=10;
gcc - gcc 中是否有针对八进制文字的警告？
即。所以如果你使用任何八进制文字，它会给你一个警告。微软编译器的同样问题。如果没有，是否有任何其他工具可以检测八进制文字。 (vim 似乎有一个很酷的技巧，它突出了第一个领先的将不同的颜色归零，但
gcc - gcc 中的函数级链接
我在旧线程中搜索。但没有找到任何线程回答我的问题。 gcc 是否像 vc++ 一样支持函数级链接？如果是，我应该提供什么选项来链接目标文件和库？最佳答案看起来 gcc 不直接支持函数级链接。您可
gcc - GCC 如何运行它的其他程序？
也许标题并没有把问题说得那么准确:我知道当我运行 gcc foo.c 时，GCC 会调用其他为它完成所有工作的子程序，从而生成主 gcc 程序只是一个界面。但这究竟是如何完成的呢？它是否使用syst
gcc - gcc 使用什么算法将通过函数指针的调用转换为直接调用？
我听说最近版本的 gcc 非常擅长将通过函数指针的调用转换为直接调用。但是，我在网上或快速浏览 gcc 的源代码上找不到任何关于它的信息。有谁知道这是否真的是真的，如果是这样，它使用什么算法来做到这一
gcc - gcc 链接器映射文件的用途是什么？
gcc/g++ 链接器选项“-Map”生成的“.map”文件用于什么？以及如何阅读它们？最佳答案我建议为您投入生产的任何软件生成一个映射文件并保留一份副本。它可用于破译崩溃报告。根据系统的不同
gcc - gcc -march选项的默认设置是什么？
gcc信息文件在有关x86-64特定标志的部分中说其他事情： There is no `-march=generic' option because `-march' ind
gcc - gcc 链接器选项可以更改已编译二进制文件中的汇编器指令吗？
我想知道 gcc 链接器选项(例如:-Wl,options)是否可以更改编译后的可执行文件中的汇编指令，因为如果您使用某些 gcc 优化选项会发生这种情况？当您比较编译后的二进制文件(例如比较签名)
gcc - GCC#pragma停止编译
是否有GCC编译指示会停止，暂停或中止编译过程？我正在使用gcc 4.1，但也希望在gcc 3.x版本上也可以使用该编译指示。最佳答案您可能需要#error: edd@ron:/tmp$ g++
gcc - gcc -ggdb 和 gcc -g 有什么区别
当我使用gcc编译C程序时我通常使用 -g 将一些调试信息放入 elf 文件中这样 gdb 就可以在需要时帮助我。但是，我注意到有些程序使用 -ggdb，因为它应该使调试信息对 gdb 更加友好。

首页

博学

6Ren·AI

商城

gcc - 在内联汇编中使用特定的 zmm 寄存器