- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我正在研究使用 x86 CPU 中的时间戳寄存器 (TSR) 来衡量基准性能。这是一个有用的寄存器,因为它以不受时钟影响的单调时间单位进行测量速度变化。非常酷。
这是一份英特尔文档,显示了使用 TSR 进行可靠基准测试的 asm 片段,包括使用 cpuid 进行管道同步。见第 16 页:
要读取开始时间,它说(我注释了一点):
__asm volatile (
"cpuid\n\t" // writes e[abcd]x
"rdtsc\n\t" // writes edx, eax
"mov %%edx, %0\n\t"
"mov %%eax, %1\n\t"
//
:"=r" (cycles_high), "=r" (cycles_low) // outputs
: // inputs
:"%rax", "%rbx", "%rcx", "%rdx"); // clobber
我想知道为什么使用临时寄存器来获取 edx
的值和 eax
。为什么不删除 movs 并直接从 edx
中读取 TSR 值和 eax
?像这样:
__asm volatile(
"cpuid\n\t"
"rdtsc\n\t"
//
: "=d" (cycles_high), "=a" (cycles_low) // outputs
: // inputs
: "%rbx", "%rcx"); // clobber
通过这样做,您可以保存两个寄存器,从而减少 C编译器需要溢出。
我说的对吗?或者这些 MOV 具有某种战略意义?
(我同意您确实需要临时寄存器来读取停止时间,因为在那种情况下,指令的顺序是相反的:你有rdtscp,...,cpuid。 cpuid 指令破坏了 rdtscp 的结果)。
谢谢
最佳答案
你是对的,这个例子很笨拙。 通常,如果 mov
是 inline-asm 语句中的第一条或最后一条指令,则说明您做错了,并且应该使用约束来告诉编译器您想要的位置输入,或输出的位置。
参见 my GNU C inline asm guides / links collection ,以及 inline-assembly 中的其他链接标记维基。 (x86 标签 wiki 也充满了一般 asm 的好东西。)
或者对于 rdtsc
具体来说,参见 Get CPU cycle count? 对于 __rdtsc()
内在的,以及@Mysticial 的回答中的良好内联 asm。
it measures in a monotonic unit of time which is immune to the clock speed changing.
是的,在过去 10 年左右制造的 CPU 上。
对于分析,以核心时钟周期为单位的时间通常更有用,而不是挂钟时间,so your microbenchmark results don't depend on power-saving / turbo.性能计数器可以做到这一点以及更多。
不过,如果您想要实时,rdtsc
是实现它的开销最低的方法。
回复:评论中的讨论:是的 cpuid
用于序列化,确保 rdtsc
和后续指令在 CPUID 之后才能开始执行。您可以在 RDTSC 之后放置另一个 CPUID,但这会增加测量开销,而且我认为准确度/精度的增益接近于零。
LFENCE 是一种更便宜的替代方案,可用于 RDTSC。 instruction ref manual entry记录了这样一个事实,即它不会让后面的指令开始执行,直到它和前面的指令退休(从内核的乱序部分的 ROB/RS)。参见 Are loads and stores the only instructions that gets reordered? ,有关使用它的具体示例,请参阅 clflush to invalidate cache line via C function .与 cpuid
等真正的序列化指令不同,它不会刷新存储缓冲区。
(在最近未启用 Spectre 缓解措施的 AMD CPU 上,lfence
甚至没有部分序列化,并且根据 Agner Fog's testing 以每时钟 4 的速度运行。Is LFENCE serializing on AMD processors?)
玛格丽特布鲁姆挖出 this useful link ,这也证实了 LFENCE 根据英特尔的 SDM 序列化 RDTSC,并且还有一些关于如何围绕 RDTSC 进行序列化的其他内容。
关于c - 英特尔的时间戳读取 asm 代码示例是否使用了比必要的多两个寄存器?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/38994549/
这个问题在这里已经有了答案: 关闭 11 年前。 Possible Duplicate: Sample data for IPv6? 除了 wireshark 在其网站上提供的内容之外,是否有可以下
我正在寻找可以集成到现有应用程序中并使用多拖放功能的示例或任何现成的解决方案。我在互联网上找到的大多数解决方案在将多个项目从 ListBox 等控件拖放到另一个 ListBox 时效果不佳。谁能指出我
我是 GATE Embedded 的新手,我尝试了简单的示例并得到了 NoClassDefFoundError。首先我会解释我尝试了什么 在 D:\project\gate-7.0 中下载并提取 Ga
是否有像 Eclipse 中的 SWT 示例那样的多合一 JFace 控件示例?搜索(在 stackoverflow.com 上使用谷歌搜索和搜索)对我没有帮助。 如果它是一个独立的应用程序或 ecl
我找不到任何可以清楚地解释如何通过 .net API(特别是 c#)使用谷歌计算引擎的内容。有没有人可以指点我什么? 附言我知道 API 引用 ( https://developers.google.
最近在做公司的一个项目时,客户需要我们定时获取他们矩阵系统的数据。在与客户进行对接时,提到他们的接口使用的目前不常用的BASIC 认证。天呢,它好不安全,容易被不法人监听,咋还在使用呀。但是没办法呀,
最近在做公司的一个项目时,客户需要我们定时获取他们矩阵系统的数据。在与客户进行对接时,提到他们的接口使用的目前不常用的BASIC 认证。天呢,它好不安全,容易被不法人监听,咋还在使用呀。但是没办法呀,
我正在尝试为我的应用程序设计配置文件格式并选择了 YAML。但是,这(显然)意味着我需要能够定义、解析和验证正确的 YAML 语法! 在配置文件中,必须有一个名为 widgets 的集合/序列。 .这
你能给我一个使用 pysmb 库连接到一些 samba 服务器的例子吗?我读过有类 smb.SMBConnection.SMBConnection(用户名、密码、my_name、remote_name
linux服务器默认通过22端口用ssh协议登录,这种不安全。今天想做限制,即允许部分来源ip连接服务器。 案例目标:通过iptables规则限制对linux服务器的登录。 处理方法:编
我一直在寻找任何 PostProjectAnalysisTask 工作代码示例,但没有看。 This页面指出 HipChat plugin使用这个钩子(Hook),但在我看来它仍然使用遗留的 Po
我发现了 GWT 的 CustomScrollPanel 以及如何自定义滚动条,但我找不到任何示例或如何设置它。是否有任何示例显示正在使用的自定义滚动条? 最佳答案 这是自定义 native 滚动条的
我正在尝试开发一个 Backbone Marionette 应用程序,我需要知道如何以最佳方式执行 CRUD(创建、读取、更新和销毁)操作。我找不到任何解释这一点的资源(仅适用于 Backbone)。
关闭。这个问题需要details or clarity .它目前不接受答案。 想改进这个问题?通过 editing this post 添加详细信息并澄清问题. 去年关闭。 Improve this
我需要一个提交多个单独请求的 django 表单,如果没有大量定制,我找不到如何做到这一点的示例。即,假设有一个汽车维修店使用的表格。该表格将列出商店能够进行的所有可能的维修,并且用户将选择他们想要进
我有一个 Multi-Tenancy 应用程序。然而,这个相同的应用程序有 liquibase。我需要在我的所有数据源中运行 liquibase,但是我不能使用这个 Bean。 我的应用程序.yml
我了解有关单元测试的一般思想,并已在系统中发生复杂交互的场景中使用它,但我仍然对所有这些原则结合在一起有疑问。 我们被警告不要测试框架或数据库。好的 UI 设计不适合非人工测试。 MVC 框架不包括一
我正在使用 docjure并且它的 select-columns 函数需要一个列映射。我想获取所有列而无需手动指定。 如何将以下内容生成为惰性无限向量序列 [:A :B :C :D :E ... :A
$condition使用说明和 $param在 findByAttributes在 Yii 在大多数情况下,这就是我使用 findByAttributes 的方式 Person::model()->f
我在 Ubuntu 11.10 上安装了 qtcreator sudo apt-get install qtcreator 安装的版本有:QT Creator 2.2.1、QT 4.7.3 当我启动
我是一名优秀的程序员,十分优秀!