- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我知道我们可以这样做来将字符移动到 xmm 寄存器:
movaps xmm1, xword [.__0x20]
align 16
.__0x20 db 0x20,0x20,0x20,0x20,0x20,0x20,0x20,0x20,0x20,0x20,0x20,0x20,0x20,0x20,0x20,0x20
但是由于这是一个内存过程,我想知道是否有更好的方法? (另外,我谈论的是 SSE2,而不是其他 SIMD 类型...)
我希望 xmm1 寄存器的每个字节都是 0x20 而不仅仅是一个字节..
(编者注:这可以称为广播或 splat。
这就是 _mm_set1_epi8(0x20)
内在函数的作用。)
最佳答案
仅使用 SSE2,从内存加载完整模式通常是最佳选择。
在您的 NASM 源中,您可以使用 times 16 db 0x20
易于维护。
使用 SSE3,您可以使用 movddup
执行 8 字节广播加载。 。使用 AVX,您可以使用 vbroadcastss
进行 4 字节广播加载。 。 这些广播负载在现代 CPU 上非常好,仅在负载端口上运行,不需要 shuffle uop。即它们与 movaps
一样便宜。在支持它们的 CPU 上,除了一个或两个以上的代码大小。 vbroadcastf128
相同到 YMM 寄存器。
大多数编译器似乎没有意识到这一点,并且会通过 _mm_set1
进行常量传播即使这会导致 32 字节常量而不是 4 字节,即使只是 mov...
在循环之前加载它,而不是将其折叠到 ALU 指令的内存操作数中。 (当 AVX512 可用时,这仍然可以通过广播加载实现。)Clang 有时确实会利用广播加载来获取简单常量。
AVX2 添加 vpbroadcastb/w/d/q
,但只有 dword 和 qword 是纯负载微指令。字节和字广播加载需要 ALU shuffle uop,因此对于恒定字节模式,您可能只想广播加载一个重复字节 4 次的双字。 (除非它是来自大型查找表的元素,然后使用字节或字广播负载或 pmovsx
符号扩展负载或其他方式来压缩该表)。
AVX512 添加 vpbroadcastb/w/d/e
from an integer register这样你就可以mov eax, 0x20202020
/vpbroadcastd xmm0, eax
如果您有 AVX512VL。
使用 SSE2,它至少需要 2 条指令,包括 ALU 洗牌,就像这样,而且可能不值得。
movd xmm0, [const_4B]
pshufd xmm0, xmm0, 0
一些重复常量可以在几条指令中动态生成,从pcmpeqd xmm0,xmm0
开始。 。请参阅What are the best instruction sequences to generate vector constants on the fly?和阿格纳·福格的指南。
这种模式似乎不容易生成。它是一种字节模式(不是字、双字或四字),并且 SSE 移位最多仅适用于字粒度。然而,如果我们知道跨字节边界移位的位是 0,那就没问题了。例如
pcmpeqd xmm0, xmm0 ; set1( -1 )
pabsb xmm0, xmm0 ; set1_epi8(1) SSSE3
pslld xmm0, 5 ; set1_epi8(1<<5)
; or with only SSE2, something even less efficient like shift / packsswb / shift
除非您确实想避免常量缓存未命中的可能性,否则这不太值得。平均而言,负载通常会领先。
关于assembly - 将 XMM 寄存器设置为重复字节模式(广播常量字节),我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/60920572/
这个问题已经有答案了: Is there any way to accept only numeric values in a JTextField? (20 个回答) It's possible i
我使用戴尔 XPS M1710。笔记本电脑的盖子、侧面扬声器和前置扬声器都有灯(3 组灯可以单独调节)和鼠标垫下方的灯。在 BIOS 中,我可以更改这些灯的颜色,至少是每个组。另外,我可以在鼠标垫下打
我知道我可以使用 在 iOS 5 中打开设置应用 [[UIApplication sharedApplication] openURL:[NSURL URLWithString:@"prefs://"
我有一个 Django 应用程序,我正在尝试为其设置文档。目录结构如下: - doc - project | - manage.py 我已经设置了路径以便 Sphinx 可以看到东西,但是当我尝试使用
我正在使用 768mb ram 运行 centos 5.5。我一直在日志中获取 server reached MaxClients setting, consider raising the MaxC
我在具有以下配置的服务器内运行了 Drupal 安装: StartServers 5 MinSpareServers 5 MaxSpareServers 15 MaxClien
是否可以使用 Microsoft.Web.Administration 包为给定的 location 配置 asp 设置? 我想以编程方式将以下部分添加到本地 IIS applicationHost.
我一直在阅读为 kube-proxy 提供参数的文档,但没有解释应该如何使用这些参数。我使用 az aks create 创建我的集群使用 azure-cli 程序,然后我获得凭据并使用 kubect
我想知道与在 PHP 中使用 setcookie() 函数相比,在客户端通过 JavaScript 设置一些 cookie 是否有任何明显的优势?我能想到的唯一原因是减少一些网络流量(第一次)。但不是
我有一个按钮可以将 body class 设置为 .blackout 我正在使用 js-cookie设置cookie,下面的代码与我的按钮相关联。 $('#boToggle').on('click'
我有一堆自定义的 HTML div。我将其中的 3 存储在具有 slide 类的 div 中。然后,我使用该幻灯片类调用 slick 函数并应用如下设置: $('.slide').slick({
我正在创建一个应该在 Windows 8(桌面)上运行的应用 我需要: 允许用户使用我的应用启动“文件历史记录”。我需要找到打开“文件历史记录”的命令行。 我需要能够显示“文件历史记录”的当前设置。
我刚买了一台新的 MacBook Pro,并尝试在系统中设置 RVM。我安装了 RVM 并将默认设置为 ➜ rvm list default Default Ruby (for new shells)
由于有关 Firestore 中时间戳行为即将发生变化的警告,我正在尝试更改我的应用的初始化代码。 The behavior for Date objects stored in Firestore
在 ICS 中,网络 -> 数据使用设置屏幕中现在有“限制后台数据”设置。 有没有办法以编程方式为我的应用程序设置“限制后台数据”? 或 有没有办法为我的应用程序调出具有选项的“数据使用”设置? 最佳
我正在尝试使用 NextJS 应用程序设置 Jest,目前在 jest.config.js : module.exports = { testPathIgnorePatterns: ["/.n
我最近升级到 FlashDevelop 4,这当然已经将我之前的所有设置恢复到原来的状态。 我遇到的问题是我无法在新设置窗口的哪个位置找到关闭它在方括号、大括号等之前插入的自动空格的选项。 即它会自动
有没有办法以编程方式访问 iPhone/iPod touch 设置? 谢谢。比兰奇 最佳答案 大多数用户设置可以通过读取存储在 /User/Library/Preferences/ 中的属性列表来访问
删除某些值时,我需要选择哪些设置来维护有序队列。我创建了带有自动增量和主键的 id 的表。当我第一次插入值时,没问题。就像 1,2,3,4,5... 当删除某些值时,顺序会发生变化,例如 1,5,3.
我正在尝试设置示例 Symfony2 项目,如此处所示 http://symfony.com/doc/current/quick_tour/the_big_picture.html 在访问 confi
我是一名优秀的程序员,十分优秀!