- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
这个question让我想知道,当前的现代编译器是否曾经发出REP MOVSB/W/D
指令。
基于此discussion,似乎在当前CPU上使用REP MOVSB/W/D
可能会有所帮助。
但是无论如何尝试,我都无法使任何当前的编译器(GCC 8,Clang 7,MSVC 2017和ICC 18)发出此指令。
对于这个简单的代码,发出REP MOVSB
可能是合理的:
void fn(char *dst, const char *src, int l) {
for (int i=0; i<l; i++) {
dst[i] = src[i];
}
}
memmove
)。是否有任何编译器使用此指令?
最佳答案
GCC具有x86调整选项,可以控制字符串操作策略以及何时进行内联与库调用。 (请参阅https://gcc.gnu.org/onlinedocs/gcc/x86-Options.html)。 -mmemcpy-strategy=strategy
采用alg:max_size:dest_align
三元组,但是蛮力方式是-mstringop-strategy=rep_byte
我必须使用__restrict
来使gcc识别memcpy模式,而不是在重叠检查/回退到哑字节循环后仅执行正常的自动矢量化。 (有趣的事实:gcc -O3即使使用-mno-sse
也会使用整数寄存器的全宽度自动矢量化。因此,如果使用-Os
(针对大小进行优化)或-O2
(小于进行全面优化)进行编译,则只会得到一个哑字节循环。 。
请注意,如果src和dst与dst > src
重叠,则结果不是memmove
。取而代之的是,您将得到一个长度为dst-src
的重复模式。 rep movsb
即使在出现重叠的情况下也必须正确实现确切的字节复制语义,因此它仍然有效(但是在当前CPU上速度很慢:我认为微码会退回到字节循环中)。
gcc仅通过识别rep movsb
模式然后选择内联memcpy作为memcpy
进入rep movsb
。 并不是直接从字节复制循环转到rep movsb
,这就是为什么可能的别名使优化失败的原因。 (不过,当别名分析无法证明它是memcpy或memmove时,对于使用-Os
快速的CPU,rep movs
考虑直接使用rep movsb
可能会很有趣。)
void fn(char *__restrict dst, const char *__restrict src, int l) {
for (int i=0; i<l; i++) {
dst[i] = src[i];
}
}
rep movs
”之外,我可能不建议针对任何用例的那些调整选项,因此它与内部函数没有什么不同。 我没有检查所有的
-mtune=silvermont
/
-mtune=skylake
/
-mtune=bdver2
(Bulldozer版本2 =打桩机)/等等调优选项,但是我怀疑它们中的任何一个都启用了该功能。因此,这是不切实际的测试,因为没有人使用
-march=native
会获得此代码源。
-xc -O3 -Wall -mstringop-strategy=rep_byte -minline-all-stringops
编译为x86-64 System V的此asm:
fn:
test edx, edx
jle .L1 # rep movs treats the counter as unsigned, but the source uses signed
sub edx, 1 # what the heck, gcc? mov ecx,edx would be too easy?
lea ecx, [rdx+1]
rep movsb # dst=rdi and src=rsi
.L1: # matching the calling convention
ret
rep movs
而优化的x86-64 SysV调用约定不是巧合(
Why does Windows64 use a different calling convention from all other OSes on x86-64?)。我认为gcc支持在设计调用约定时使用它,因此节省了指令。
rep_8byte
做了很多设置来处理不是8的倍数的计数,也许是对齐,我没有仔细看。
rep movsb
将是一个糟糕的选择,因此,编译器默认情况下不执行此操作是一件好事。 (只要它们做得更好。)
Intel's optimization manual包含关于memcpy和memset的部分,其中包含SIMD vector 和
rep movs
。另请参见
http://agner.org/optimize/和
the x86 tag wiki中的其他性能链接。
dst=__builtin_assume_aligned(dst, 64);
或任何其他将对齐方式传达给编译器的方式会做任何不同的事情,例如某些数组上的
alignas(64)
。)
rep movs
/
rep stos
的启动开销,从而使它们在小批量生产时更加有用。 (当前
rep
字符串微码的启动开销很大:
What setup does REP do?)
rep movsb
(在检查内部配置变量后(在glibc初始化自身时根据CPU检测设置)。我不确定它会在哪些CPU上实际使用
rep movsb
(如果有),但是否支持将其用于大型副本。
rep movsb
对于像这样的字节循环计数较小的代码大小和不可怕的缩放可能是一个非常合理的选择,并且可以安全地处理不太可能的重叠情况。
rep movsb
的某种最后沟渠的窥孔优化可能是个好主意。 (或者对于像MSVC这样的编译器,即使在完全优化的情况下也会产生字节循环。)
-Os
(优化代码大小而不是速度),那就太好了。 (有关x86内存带宽单线程与所有内核,避免RFO的NT存储以及使用避免RFO的高速缓存协议(protocol)的
rep movs
的信息,也请参阅
Enhanced REP MOVSB for memcpy,以获取更多信息)。
rep movsb
不适用于大型副本,因此推荐的策略是
rep movsd
或
movsq
,对最后几个计数进行特殊处理。 (假设您将要完全使用
rep movs
,例如在无法触摸SIMD vector 寄存器的内核代码中使用。)
-mno-sse
自动矢量化比
rep movs
差很多,因此gcc在检查重叠后一定要使用
rep movsb
或
rep movsq
,而不是qword复制循环,除非期望输入少(例如64个字节)是常见的。
call
/
ret
指令和动态链接间接的实际成本)。
-fno-unroll-loops
的原因。 (不过,自动矢量化已在
-O3
上启用,并且可以为诸如此类的一些小循环创建大量代码。gcc在循环序言/结尾中花费大量代码大小,但是在实际循环;尽管如此,它仍然知道每次运行外部代码时,循环将运行数百万次迭代。)
n % 32
字节的标量会很糟糕,因此理想情况下,PGO会将其变为特殊情况下较小的计数。 (但我不太乐观。)
rep movs
用作
-Os
,如果有更多关于该uarch的信息可用,则可以使用
-mtune=icelake
。
-O2
进行编译,因此除自动矢量化程序之外的
rep movs
窥孔可能会有所作为。 (但问题是这是正面的还是负面的差异)!
关于c++ - 当前的任何C++编译器都发出 “rep movsb/w/d”吗?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/51121856/
我试图通过这段代码读取未知数量的整数: while (1) { int c = getchar (); if (c == EOF) break;
我正试图找到一个类似于谷歌分析日期选择器的日期选择器: 知道 jQuery 是否提供了类似的东西吗? 最佳答案 这个 Twitter Bootstrap 风格的日期范围选择器非常接近。 https:/
我正在使用 javascript。如何获取当前 URL 的路径并将其分配给我的代码?这是我的代码: $(document).ready(function() { $(".share").hides
如何获得今天的Julian day number (JDN)相等的?或任何日期? 我看了又看,但只发现了一些产生“year-dayOfYear”的函数,而不是:2457854。 最佳答案 在 bash
我有相当简单的 UDP 服务器写在 c 上。 有时我需要知道在套接字中排队的所有 udp 数据包(字节)的当前长度。 据我了解,getsockopt 没有得到这样的信息。 欢迎使用 Linux 和 F
我一直在寻找几个小时来找到一个可以在图像中添加诸如“填充:5px”之类的东西的插件。每个人都通过纯 html 做到这一点吗?我们的客户需要一种方法来简单地使用按钮或右键单击上下文菜单来添加它。有什么建
是否有可能获得当前正在执行的 TCL 脚本的完整路径? 在 PHP 中,它将是:__FILE__ 最佳答案 根据“当前正在执行的 TCL 脚本”的含义,您实际上可能会寻找 info script ,甚
我最近从直接使用 ISession 转向了包装的 ISession,即工作单元类型模式。 我曾经使用 SQL Lite(内存中)对此进行测试。我有一个简单的帮助器类,它配置我的 SessionFact
我按照步骤操作 here在 WebStorm 中配置代码完成和其他内容,但我仍然收到以下语法错误。 我该如何解决这个问题? 最佳答案 通过相应地将“JavaScript 语言版本”(Settings/
我可以为我团队的 TFS 当前 Sprint 任务板添加书签吗?我们有两周的冲刺,因此 URL 每两周更改一次。 默认 URL 的形式为: http://[Server]/tfs/[Project]/
是否有 Subversion 命令可以显示当前版本号? 在svn checkout之后,我想启动一个脚本并需要变量中的修订号。如果有像 svn info get_revision_number 这样的
我正在编写表单的一个组件 首次安装组件时,sources={{}} ,一本空字典。由于该组件包装了现有的 Javascript 库,因此我正在实现一个自定义比较函数。为了让这个 diffing 函数
无论系统时间设置为多少以及机器所在的时区,我都需要正确的 UTC 时间。 (即使我必须打电话到互联网才能同步......) 是否有一些库或其他方法可以优雅地做到这一点? 最佳答案 如果您想获得准确可靠
我一边编码,一边拿出一些我和 friend 建立的旧网站来重新开始工作。我已经有一段时间没有做过任何 AJAX 了,当我试图找出我的代码失败的地方时,我发现没有显示很多资源。我猜这是因为我使用的是旧方
由于对性能的巨大影响,我从不怀疑我现在的桌面CPU是否有分支预测。当然可以。但各种 ARM 产品又如何呢? iPhone或Android手机有分支预测吗?较旧的任天堂 DS?基于 PowerPC 的
我有一个具有以下有效负载的 JWT: { "id": "394a71988caa6cc30601e43f5b6569d52cd7f6df", "jti": "394a71988caa6cc30
从其他一些帖子中,我能够通过以下方式获取当前 URI: 但是以下方法不起作用: 我很好奇为什么上面的方法不起作用,以及如何将当前 URI 分配给字符串。 最佳答案 每the javadocs ,g
我在表格 View 中有几个单元格。现在在任何给定的时间点,我想计算 View 中单元格的当前高度,即如果它是 View 的 3/4,它应该返回 (cellheight)*3/4 高度。 我通过以下方
这是网站的身份验证脚本。这安全吗?是最近的节目吗?它已经过时了吗?是否有“更好更安全的方法”我很新,但我没有看到太多地方使用 header 授权。 如有任何帮助,我们将不胜感激!这是我制作的第一个登录
我已经在其他 stackoverflow 线程上检查过这个错误,但在我的代码中没有发现任何错误。也许我累了,但我觉得还好。 网站.urls.py: from django.conf.urls impo
我是一名优秀的程序员,十分优秀!