performance - 哪个指令序列对于将一个或另一个寄存器归零具有更好的性能？-6ren

performance - 哪个指令序列对于将一个或另一个寄存器归零具有更好的性能？

转载作者：行者123 更新时间：2023-12-05 02:38:54

26

4

教授给我布置了一项作业，其中一部分引发了一场关于无分支编程的对话。目标是将此 C 代码转换为 MIPS 汇编(假设 a 和 b 位于寄存器 $s0 和 $s1，分别)使用 slt 指令。

if (a <= b)
  a = 0;
else
  b = 0;

预期的响应是:

        slt $t0,$s1,$s0    ; Set on less-than (if $s1 < $s0 then set $t0 to 1, else 0).
        bne $t0,$0,else    ; Branch on not-equal (jump to `else` if $t0 != $0)
        add $s0,$0,$0      ; $s0 = $0 + $0, aka $s0 = $0 * 2
        j   done           ; Unconditional jump to `done`
else:   sub $s1,$0,$0      ; $s1 = $0 - $0, aka `$s1 = 0`
done:

然而，我提交了以下无分支方案(据我了解，无分支编程在性能方面是首选):

        slt  $t0,$s1,$s0    ; Set on less-than (if $s1 < $s0 then set $t0 to 1, else 0).
        mul  $s0,$s0,$t0    ; $s0 = $s0 * $t0 (truncated to 32 bits)
        xori $t0,$t0,0x1    ; $t0 = XOR( $t0, 1 )
        mul  $s1,$s1,$t0    ; $s1 = $s1 * $t0 (truncated to 32 bits)

我知道这是一个小案例，其中任何性能提升都可以忽略不计，但我想知道我使用的思路是否正确。

我的教授指出 mul 指令很复杂(阅读:硬件密集型)，因此(如果在硬件中实现)通过使用较少的指令获得的任何性能提升最终都会由于这种复杂性而丢失.这是真的吗？

最佳答案

这不可能说，因为您没有指定 MIPS 实现，多年来已经有很多。

但是，乘法可能更昂贵，尤其是在较早的 MIPS 处理器上，其中每个乘法可能需要两个(或三个)周期。

无条件控制流的另一种方法是从 slt 中减去一个并使用 and 而不是 mul，之后 xor 与 -1。这将比 mul 版本多花费一条指令，所以不清楚哪个更快，但确实涉及“更简单”的指令。

    slt  $t0,$s1,$s0    ; Set on less-than (if $s1 < $s0 then set $t0 to 1, else 0).
    subi  $t0, $t0, 1   ; 1/true->0, 0/false->-1
    and  $s1,$s1,$t0    ; $s1 &= $t0-1        mask is either 0 or -1
    xori $t0,$t0,-1     ; $t0 = ~ $t0
    and  $s0,$s0,$t0    ; $s1 &= ~ (t0-1)     mask is either -1 or 0

这是否比条件逻辑更快取决于处理器、和数据集，假设这是在循环中(如果在某个级别不在循环中，那么问题是 lessor重要性)。

数据集将决定分支预测是否有效。每次分支预测错误，都会花费几个周期(当然取决于处理器实现)。如果分支预测 100% 有效，那么条件逻辑可能是最好的。但是，如果数据集违背分支预测，则每次执行可能会产生几个周期的开销，因此无条件逻辑可能是最好的。

如果处理器有一些额外的操作码，这样就不需要减 1，那么 else 部分也可以取反，那就太好了。在这种假设情况下，我们将:

slt $t0, $s1, $s0
sameIfTrueOrZero  $s0, $s0, $t0   # $s0 = ($t0 ? $s0 : 0)
sameIfFalseOrZero $s1, $s1, $t0   # $s1 = ($t0 ? 0 : $s1)

这些将是硬件实现的简单指令——它们不会对 ALU 或指令和操作数编码造成负担。

一些更高级的处理器可能能够在上述某些方面融合操作或双重问题，从而降低执行成本。

关于performance - 哪个指令序列对于将一个或另一个寄存器归零具有更好的性能？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/69384991/

26

4

0

文章推荐： rust - 如何激活可选依赖项？

文章推荐： linux - Linux 的设备驱动程序文档

文章推荐： sql - 从 oracle 过程返回 Json 字符串

html - 是完全不渲染 HTML 更好，还是添加显示 :none? 更好
据我所知，根本不为元素呈现 HTML，或添加 display:none，似乎具有完全相同的行为:两者都使元素消失并且不与 HTML 交互。我正在尝试禁用和隐藏一个复选框。所以HTML的总量很小；我无
android - 在单个进程中使用 AsyncTask(或 Timer)更好，还是在单独的进程中使用 Service 更好？
我刚刚读了Android Architecture Tutorial: Developing an App with a Background Service (using IPC) .基本上是让服
mysql - 在 SELECT 中使用 SUM() 更好，还是在 SUB-SELECT 中使用 SUM() 更好？
我有两个查询具有相同的结果，现在我想知道哪个查询更优化？在选择中: select t1.*, sum(t2.value) as total_votes from table1 t1 left joi
blocking - 为什么 cpu bound 对阻塞 I/O 更好，而 I/O bound 对非阻塞 I/O 更好
有人告诉我，对于 I/O 绑定(bind)的应用程序，非阻塞 I/O 会更好。对于 CPU 密集型应用程序，阻塞 I/O 会好得多。我找不到这种说法的原因。试过谷歌，但很少有文章只是触及这个话题而没有
python - 使复杂性更小(更好)
我有一个算法可以在数字列表中寻找好的对。一个好的配对被认为是索引 i 小于 j 且 arr[i] 1: # Finding the mid of the array
python - 使复杂性更小(更好)
我有一个算法可以在数字列表中寻找好的对。一个好的配对被认为是索引 i 小于 j 且 arr[i] 1: # Finding the mid of the array
javascript - 更好/更快地修改嵌套对象不同深度下找到的所有匹配属性的方法
我从 API 收到一个 json，我需要解析并修改一个属性值。问题是，我收到的 json 数据的嵌套结构不一致，我无法控制它。这将禁止我指定在特定深度(如 parsedJson.children[0
mysql - 哪一个运行起来更安全/更好？
我有 451 个城市的坐标。现在我想计算每个城市之间的距离，然后根据该距离对一些结果进行排序。现在我有两个选择: 我可以运行一个循环来计算每个可能的城市组合的距离并将它们存储到一个表中，这将产生大约
sql - 哪个查询计划更快/更好
对于返回相同结果的不同查询，我有两个查询计划我想知道是否有人可以告诉我哪个“更好”，以及为什么。 SELECT * FROM bids order by (select ranking from us
android - 请解释阵列适配器及其用途。更好
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭 7 年前。 Improve this qu
c++ - 执行直接指针操作还是 [] 更好
我有一个二维数组。我需要尽可能快地对其执行一些操作(函数每秒将被调用十几次，所以让它变得高效会很好)。现在，假设我想获取元素 A[i][j]，简单地使用 A[i][j] 在速度上有什么不同吗和 *(
c# - 什么时候在字符串前使用@更好？
在声明或使用字符串的代码中，我通常会看到开发人员这样声明它: string randomString = @"C:\Random\RandomFolder\ThisFile.xml"; 代替: str
html - 为什么把所有的标签都写成一种样式比使用通用选择器(*)更好？
这个问题在这里已经有了答案: 关闭 10 年前。 Possible Duplicate: Why don't CSS resets use '*' to cover all elements? 我正
python - 更好/更快地循环遍历集合或列表？
如果我有一个包含许多重复项的 python 列表，并且我想遍历每个项目，而不是重复项，最好使用一个集合(如 set(mylist)，或者找到另一种方法来创建没有重复的列表？我想只是循环遍历列表并检查重
java - 没有实例的最终常量类如何比常量接口(interface)更好？
在阅读常量接口(interface)反模式时，我发现没有实例的最终常量类比常量接口(interface)更好。请解释一下怎么做？ public interface ConstIfc { publ
C:为什么 &= 比 = 更好？
我正在查看我继承的一些旧代码，我真的不喜欢某些地方的风格。我真的不喜欢它的外观的一件事是: bool func() { bool ret = true; ret &= test1();
java - @Path 注解中的路径参数，更好
关闭。这个问题是opinion-based 。目前不接受答案。想要改进这个问题吗？更新问题，以便 editing this post 可以用事实和引文来回答它。 . 已关闭 4 年前。 Improv
c++ - 访问者模式是否比受控使用 RTTI 更好？
我经常发现自己试图使用 boost/QT 信号解耦对象。实现这一点的简单方法是针对我要通信的每个具体类型，创建一个新的信号和插槽签名并连接所有相关对象。这导致了访问者模式，理想情况下我想发出一个访问者
java - 为什么这段代码片段中的 lambda 更好？
我正在 https://docs.oracle.com/javase/tutorial/java/javaOO/lambdaexpressions.html 上阅读有关 lambda 的内容在方法
java - 为什么从创建列表的方法返回 unmodifyingList 更好？
public List getInts() { List xs = new ArrayList(); xs.add(1); // return Collections.unmo

首页

博学

6Ren·AI

商城

performance - 哪个指令序列对于将一个或另一个寄存器归零具有更好的性能？