- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
在浏览可用的内在函数时,我注意到没有地方可以看到水平的addsub / subadd指令可用。在过时的3DNow中可用!扩展名,但是出于明显的原因,它的使用是不实际的。是什么原因导致SSE3扩展中无法执行此类“基本”操作以及类似的水平操作和addsub操作?
顺便问一下,现代指令集(SSE3,SSE4,AVX等)中最快的替代方法是什么? (每个值2倍,即__m128d)
最佳答案
通常,您首先要避免将代码设计为使用水平操作。尝试对多个数据并行执行相同的操作,而不是对具有不同元素的不同操作。但是有时局部优化仍然值得,水平填充可能比纯标量更好。
英特尔尝试在SSE3中添加水平操作,但从未添加支持它们的专用硬件。它们在支持它们的所有CPU(包括AMD)上解码为2个混洗+ 1个垂直操作。参见Agner Fog's instruction tables。除SSE4.1 dpps
/ dppd
(相对于手动改组通常不值得使用)以外,最新的ISA扩展大多不包含更多的水平操作。
SSSE3 pmaddubsw
很有意义,因为element-width已经是扩大乘法的问题,而且SSE4.1 phminposuw
立即获得了专用的硬件支持,使其值得使用(并且如果不做同样的事情,将花费大量的操作,并且对视频特别有用)编码)。但是AVX / AVX2 / AVX512水平操作非常稀缺。 AVX512确实引入了一些不错的混洗功能,因此,如果需要,您可以使用功能强大的2输入通道交叉混洗功能构建自己的水平操作。
如果最有效的解决方案已经包括以两种不同的方式将两个输入混在一起并将其馈送到加法或减法,那么haddpd
是一种有效的编码方式;尤其是在没有AVX的情况下,准备输入可能也需要movaps
指令,因为shufpd
是破坏性的(使用内在函数时编译器会静默发出,但仍会消耗前端带宽,并且在Sandybridge等早期版本的CPU上的延迟无法消除reg-reg动作)。
但是,如果您打算两次使用相同的输入,那么haddpd
是错误的选择。另请参见Fastest way to do horizontal float vector sum on x86。 hadd
/ hsub
只是两个不同输入的好主意,例如作为即时转置的一部分,作为矩阵上其他操作的一部分。
无论如何,关键是,如果需要,可以在两个混洗+ SSE3 haddsub_pd
中构建自己的addsubpd
(在支持该功能的CPU上确实具有单-uop硬件支持。)使用AVX,它的速度将与一样快假设的haddsubpd
指令,并且没有AVX通常会花费一个额外的movaps
,因为编译器需要将两个输入都保留到第一个shuffle中。 (代码大小会更大,但是我在谈论的是前端的成本,后端的执行端口压力。)
// Requires SSE3 (for addsubpd)
// inputs: a=[a1 a0] b=[b1 b0]
// output: [b1+b0, a1-a0], like haddpd for b and hsubpd for a
static inline
__m128d haddsub_pd(__m128d a, __m128d b) {
__m128d lows = _mm_unpacklo_pd(a,b); // [b0, a0]
__m128d highs = _mm_unpackhi_pd(a,b); // [b1, a1]
return _mm_addsub_pd(highs, lows); // [b1+b0, a1-a0]
}
gcc -msse3
and clang (on Godbolt)我们得到了预期的结果: movapd xmm2, xmm0 # ICC saves a code byte here with movaps, but gcc/clang use movapd on double vectors for no advantage on any CPU.
unpckhpd xmm0, xmm1
unpcklpd xmm2, xmm1
addsubpd xmm0, xmm2
ret
b
起始的同一寄存器中而不是a
的返回值时会遇到麻烦。 (例如,如果args反向,则为haddsub(b,a)
)。# gcc for haddsub_pd_reverseargs(__m128d b, __m128d a)
movapd xmm2, xmm1 # copy b
unpckhpd xmm1, xmm0
unpcklpd xmm2, xmm0
movapd xmm0, xmm1 # extra copy to put the result in the right register
addsubpd xmm0, xmm2
ret
movhlps
而不是unpckhpd
)仍然只使用一个寄存器副本:# clang5.0
movapd xmm2, xmm1 # clangs comments go in least-significant-element first order, unlike my comments in the source which follow Intel's convention in docs / diagrams / set_pd() args order
unpcklpd xmm2, xmm0 # xmm2 = xmm2[0],xmm0[0]
movhlps xmm0, xmm1 # xmm0 = xmm1[1],xmm0[1]
addsubpd xmm0, xmm2
ret
__m256d
vector 的AVX版本,实际上想要的是_mm256_unpacklo/hi_pd
的行内行为,对于而言,它是一次获得偶数/奇数元素的功能。static inline
__m256d haddsub256_pd(__m256d b, __m256d a) {
__m256d lows = _mm256_unpacklo_pd(a,b); // [b2, a2 | b0, a0]
__m256d highs = _mm256_unpackhi_pd(a,b); // [b3, a3 | b1, a1]
return _mm256_addsub_pd(highs, lows); // [b3+b2, a3-a2 | b1+b0, a1-a0]
}
# clang and gcc both have an easy time avoiding wasted mov instructions
vunpcklpd ymm2, ymm1, ymm0 # ymm2 = ymm1[0],ymm0[0],ymm1[2],ymm0[2]
vunpckhpd ymm0, ymm1, ymm0 # ymm0 = ymm1[1],ymm0[1],ymm1[3],ymm0[3]
vaddsubpd ymm0, ymm0, ymm2
addsubpd
// returns [a1+a0 a1-a0]
static inline
__m128d sumdiff(__m128d a) {
__m128d swapped = _mm_shuffle_pd(a,a, 0b01);
return _mm_addsub_pd(swapped, a);
}
movapd xmm1, xmm0
shufpd xmm1, xmm0, 1
addsubpd xmm1, xmm0
movapd xmm0, xmm1
ret
xmm0
: # compilers should do this, but don't
movapd xmm1, xmm0 # a = xmm1 now
shufpd xmm0, xmm0, 1 # swapped = xmm0
addsubpd xmm0, xmm1 # swapped +- a
ret
a
值来释放xmm0来获取swapped
。通常,在另一个寄存器中产生结果是很好的(甚至更好的选择),因此,仅当查看函数的独立版本时,内联时这几乎不是问题
关于sse - SSE-不存在的hardsub固有的吗?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/48757458/
SELECT *, `o_cheque_request.member_id`, `o_cheque_request.wallet_id` FROM `o_cheque_request`, `o_mem
根据某一条件从数据库表中查询 『有』与『没有』,只有两种状态,那为什么在写SQL的时候,还要**SELECT count(*)**呢? 无论是刚入道的程序员新星,还是精湛沙场多年的程序员老白,都是一如
我试图找出一个文件是否存在,如果存在,验证css样式是否已经存在,如果不存在,将它们写在文件末尾... 我已经完成了这一切,但分 3 个步骤: 该文件是否存在? FileInfo fi= new Fi
我们正在开发即时消息传递应用程序,并且需要在用户的化身上用绿点显示用户 friend 的“状态”。 “状态”远远超出了“my_app_is_opened_and_on_focus”,这意味着(我猜可能
模式 Movie(title, year, director, budget, earnings) Actor(stagename, realname, birthyear) ActedIn(stag
我有一个正在尝试创建的 MySQL 触发器,但无法获得正确的语法。 触发器应该遍历一组关键字并将其与插入数据库的新帖子的标题进行匹配。如果找到匹配项,它应该将新帖子分配给该存储桶并更新存储桶的关键字集
我有 3 个表......用户、更新和碰撞。 我想向发出 api 请求的用户返回最新订单的 feed 更新,并提供显示 feed 中每个状态所需的所有数据。我还需要包括更新是否已被发出 api 请求的
我正在尝试呈现一个带有 UIView 的 UIViewController。 以下是我在 viewDidLoad 方法中尝试的代码。 //create the view controller UIVi
我正在努力弄清楚如何在不对 mysql 进行两次调用的情况下从一个表中检查两件事。 我有一个 Members 表。我想测试MemberID 列中是否存在某个值,以及PhoneNumber 列中是否存在
以下代码给出了一个没有 Do Compile 错误的循环: Loop Sheets("Snap").Rows(1).AutoFilter Field:=5, Criteria1:=List
是否可以通过检查“dig”的输出来检查域名的存在? 在绑定(bind)源中,我发现了这些常量: 0 DNS_R_NOEROR 1 DNS_R_FORMERR 2 DNS_R_SERVFAIL 3 DN
Controller 有问题 我在 Windows 上使用服务器,一切正常,但在互联网上我试图访问页面 social_apartament/beauty_life/并且找不到该页面,代码错误 404这
/** This is struct S. */ struct S(T) { static if(isFloatingPoint!T) { /// This version works
JVM 类型删除如何帮助 Clojure?没有它,Clojure 还能存在吗?如果 JVM 有具体化的类型会发生什么?也就是说,Clojure 将如何改变? 最佳答案 Clojure 根本不会有太大变
许多论文等提到对“system()”的调用是不安全且不可移植的。我不反对他们的论点。 不过,我注意到许多 Unix 实用程序都有一个等效的 C 库。如果没有,源可用于各种这些工具。 虽然许多论文和此类
在我的 Node js 应用程序中,我有一个用户登录 api。上面我在服务器端代码中创建了一个名为 customerid 的变量。现在,当用户身份验证成功时。我将他的 userid 值存储在我的 cu
我有一个工作资源管理器组,由 Ubuntu 14.04 虚拟机、网络接口(interface)、公共(public) IP 地址和存储帐户组成。我已经从这组资源中创建了一个模板。 当我尝试部署这组资源
我有一个函数createminor4(arr,锦标赛)它基本上将arr分成4组,每组8人,然后将它们一次交换到tourney 1组。从那里它插入四个{},其中有 4 个带有空数组的键。 我已经在 Ch
我有一个图表,其中有两个图例。我需要更改其中一个图例的点的大小。 我需要更改图例中“市场类型”的项目符号大小。我使用示例 here但不适用于我的图表。 我的代码如下: k <- ggplot(subs
我有 fiddle here展示我正在尝试做的事情。 我有一个动态生成的表,因此列可以按用户选择的任何顺序显示。因此,我尝试获取两个特定 header 的索引,以便可以将 CSS 类添加到这两列以供稍
我是一名优秀的程序员,十分优秀!