c# - 为什么这个添加 SIMD 数组的示例可能无法证明比简单的实现有任何性能提升？-6ren

c# - 为什么这个添加 SIMD 数组的示例可能无法证明比简单的实现有任何性能提升？

转载作者：行者123 更新时间：2023-11-30 17:29:12

class Program
{
    static void Main(string[] args)
    {
        Console.WriteLine(Vector.IsHardwareAccelerated ? "SIMD supported" : "SIMD not supported.");

        var rand = new Random();

        var numNums = 10000000;
        var arr1 = Enumerable.Repeat(0, numNums).Select(x => (int) (rand.NextDouble() * 100)).ToArray();
        var arr2 = Enumerable.Repeat(0, numNums).Select(x => (int) (rand.NextDouble() * 100)).ToArray();

        var simdResult = new int [numNums];
        var conventionalResult = new int [numNums];

        var watch = System.Diagnostics.Stopwatch.StartNew();
        ConventionalArrayAddition(arr1, arr2, conventionalResult);
        watch.Stop();
        Console.WriteLine("Conventional time :" + watch.ElapsedMilliseconds);

        var watch2 = System.Diagnostics.Stopwatch.StartNew();
        SIMDArrayAddition(arr1, arr2, simdResult);
        watch2.Stop();
        Console.WriteLine("Simd time :" + watch2.ElapsedMilliseconds);

        Console.ReadKey();
    }

    public static void SIMDArrayAddition(int[] lhs, int[] rhs, int [] result)
    {
        var simdLength = Vector<int>.Count;
        var i = 0;
        for (; i <= lhs.Length - simdLength; i += simdLength)
        {
            var va = new Vector<int>(lhs, i);
            var vb = new Vector<int>(rhs, i);
            (va + vb).CopyTo(result, i);
        }

        for (; i < lhs.Length; ++i)
        {
            result[i] = lhs[i] + rhs[i];
        }
    }

    public static void ConventionalArrayAddition(int[] lhs, int[] rhs, int[] result)
    {
        for (int i = 0; i < lhs.Length; i ++)
        {
            result[i] = lhs[i] + rhs[i];
        }
    }
}

此代码改编自 https://instil.co/2016/03/21/parallelism-on-a-single-core-simd-with-c/ 上的示例之一.

我正在将其编译为 .Net Framework 控制台应用程序(我已经尝试过 4.6.1 和 4.7)，并选择了“优化代码”，作为 x64。

我得到的结果是:

Conventional time :22
Simd time :23

如果我在 .net core 中进行类似的测试，我确实会使用矢量方法获得更快的结果，但这只是因为 .net core 下的简单实现要慢得多(大约需要 55 毫秒)。核心中的矢量化实现通常比我在 .net 框架中获得的结果稍慢(比如 24 毫秒)。

我的处理器是 i5-7500T，我在 i5-7200 上得到了类似的结果。

是否可能还有其他一些我忽略的简单设置？或者可能是编译器以某种方式优化以在天真的代码中使用 simd 指令？

更新:按照 https://blogs.msdn.microsoft.com/clrcodegeneration/2007/10/19/how-to-see-the-assembly-code-generated-by-the-jit-using-visual-studio/ 中的说明进行操作，这里是反汇编ConventionalArrayAddition() :

            for (int i = 0; i < lhs.Length; i++)
00000000  sub         rsp,28h 
00000004  xor         eax,eax 
00000006  mov         r9d,dword ptr [rcx+8] 
0000000a  test        r9d,r9d 
0000000d  jle         000000000000008A 
0000000f  test        rdx,rdx 
00000012  setne       r10b 
00000016  movzx       r10d,r10b 
0000001a  and         r10d,1 
0000001e  test        r8,r8 
00000021  setne       r11b 
00000025  movzx       r11d,r11b 
00000029  test        r11d,r10d 
0000002c  je          0000000000000066 
0000002e  cmp         dword ptr [rdx+8],r9d 
00000032  setge       r10b 
00000036  movzx       r10d,r10b 
0000003a  cmp         dword ptr [r8+8],r9d 
0000003e  setge       r11b 
00000042  movzx       r11d,r11b 
00000046  test        r11d,r10d 
00000049  je          0000000000000066 
            {
                result[i] = lhs[i] + rhs[i];
0000004b  movsxd      r10,eax 
0000004e  mov         r11d,dword ptr [rcx+r10*4+10h] 
00000053  add         r11d,dword ptr [rdx+r10*4+10h] 
00000058  mov         dword ptr [r8+r10*4+10h],r11d 
            for (int i = 0; i < lhs.Length; i++)
0000005d  inc         eax 
0000005f  cmp         r9d,eax 
00000062  jg          000000000000004B 
00000064  jmp         000000000000008A 
00000066  movsxd      r10,eax 
00000069  mov         r11d,dword ptr [rcx+r10*4+10h] 
0000006e  cmp         eax,dword ptr [rdx+8] 
00000071  jae         000000000000008F 
00000073  add         r11d,dword ptr [rdx+r10*4+10h] 
00000078  cmp         eax,dword ptr [r8+8] 
0000007c  jae         000000000000008F 
0000007e  mov         dword ptr [r8+r10*4+10h],r11d 
00000083  inc         eax 
00000085  cmp         r9d,eax 
00000088  jg          0000000000000066 
0000008a  add         rsp,28h 
            }
        }
0000008e  ret 
0000008f  call        000000005FA91300 
00000094  int         3

对于 SIMDArrayAddition():

    var simdLength = Vector<int>.Count;
00000000  push        rdi 
00000001  push        rsi 
00000002  sub         rsp,28h 
00000006  vzeroupper 
00000009  xor         eax,eax 
            for (; i <= lhs.Length - simdLength; i += simdLength)
0000000b  mov         r9d,dword ptr [rcx+8] 
0000000f  mov         r10d,r9d 
00000012  sub         r10d,8 
00000016  test        r10d,r10d 
00000019  jl          0000000000000064 
0000001b  mov         r11d,dword ptr [rdx+8] 
0000001f  mov         esi,dword ptr [r8+8] 
00000023  cmp         eax,r9d 
00000026  jae         00000000000000A2 
00000028  lea         edi,[rax+7] 
0000002b  cmp         edi,r9d 
0000002e  jae         00000000000000A2 
00000030  vmovupd     ymm0,ymmword ptr [rcx+rax*4+10h] 
                var vb = new Vector<int>(rhs, i);
00000037  cmp         eax,r11d 
0000003a  jae         00000000000000A2 
0000003c  cmp         edi,r11d 
0000003f  jae         00000000000000A2 
00000041  vmovupd     ymm1,ymmword ptr [rdx+rax*4+10h] 
                (va + vb).CopyTo(result, i);
00000048  vpaddd      ymm0,ymm0,ymm1 
0000004d  cmp         eax,esi 
0000004f  jae         00000000000000A7 
00000051  cmp         edi,esi 
00000053  jae         00000000000000AC 
00000055  vmovupd     ymmword ptr [r8+rax*4+10h],ymm0 
            for (; i <= lhs.Length - simdLength; i += simdLength)
0000005c  add         eax,8 
0000005f  cmp         r10d,eax 
00000062  jge         0000000000000023 
            }

            for (; i < lhs.Length; ++i)
00000064  cmp         r9d,eax 
00000067  jle         0000000000000098 
00000069  mov         r11d,dword ptr [rdx+8] 
0000006d  mov         esi,dword ptr [r8+8] 
            {
                result[i] = lhs[i] + rhs[i];
00000071  cmp         eax,r9d 
00000074  jae         00000000000000A2 
00000076  movsxd      r10,eax 
00000079  mov         edi,dword ptr [rcx+r10*4+10h] 
0000007e  cmp         eax,r11d 
00000081  jae         00000000000000A2 
00000083  add         edi,dword ptr [rdx+r10*4+10h] 
00000088  cmp         eax,esi 
0000008a  jae         00000000000000A2 
0000008c  mov         dword ptr [r8+r10*4+10h],edi 
            for (; i < lhs.Length; ++i)
00000091  inc         eax 
00000093  cmp         r9d,eax 
00000096  jg          0000000000000071 
00000098  vzeroupper 
            }
        }
0000009b  add         rsp,28h 
0000009f  pop         rsi 
000000a0  pop         rdi 
000000a1  ret 
000000a2  call        000000005FA91250 
000000a7  call        000000005FA91B00 
000000ac  call        000000005FA91A50 
000000b1  int         3

这些是从另一台机器 (i7-4790) 获得的，它产生类似的时间。

最佳答案

将实现更改为 AddTo 以减少源和目标的数量，将性能提高大约 70%。这种添加在许多情况下都很有用，以及大多数 CPU 内部添加的工作方式，减少内存带宽和缓存需求。

    public static void SIMDArrayAddTo(int[] lhs, int[] rhs)
    {
        var simdLength = Vector<int>.Count;
        var end = lhs.Length - simdLength;
        var i = 0;
        for (; i <= end; i += simdLength)
        {
            var va = new Vector<int>(lhs, i);
            var vb = new Vector<int>(rhs, i);
            (va + vb).CopyTo(lhs, i);
        }

        for (; i < lhs.Length; ++i)
        {
            lhs[i] += rhs[i];
        }
    }

我也尝试展开 SSE 循环，但它似乎没有帮助。在 HPCsharp nuget 包中添加了与此类似的版本，包括多核版本。

此外，在上述功能的基础上添加了多核并行性，但并未提高性能。如果有人可以访问具有 2 个以上内存 channel 的 CPU，那么当有更多系统内存带宽可用时，看看这段代码如何扩展将会很有趣。

关于c# - 为什么这个添加 SIMD 数组的示例可能无法证明比简单的实现有任何性能提升？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/51553540/

文章推荐： c# - PrimaryLanguageOverride 在发布 appxbundle 中不起作用

文章推荐：更改内容 innerHTML 时，Javascript parentNode 为空

文章推荐： c# - 使用导航属性的 T-SQL 到 LINQ to SQL

文章推荐： c# - 如何更改为另一个 View Controller (解释清楚)

javascript - Ember.js，性能，性能 :
性能:数据存储写入与请求日志写入
我们希望通过我们的应用收集使用情况统计信息。因此，我们希望在服务器端的某个地方跟踪用户操作。就性能而言，哪个选项更合适: 在 App Engine 请求日志中跟踪用户操作。即为每个用户操作写入一个日
LINQ 性能
在针对对象集合的 LINQ 查询的幕后究竟发生了什么？它只是语法糖还是发生了其他事情使其更有效的查询？最佳答案您是指查询表达式，还是查询在幕后的作用？查询表达式首先扩展为“普通”C#。例如: v
WPF 性能
我正在构建一个简单的照片库应用程序，它在列表框中显示图像。 xaml 是:
java缓存系统和静态HashMap存储-性能
对于基于 Web 的企业应用程序，使用“静态 Hashmap 存储对象” 和 apache java 缓存系统有何优缺点？哪一个最有利于性能并减少堆内存问题例如: Map store=Applica
jquery存储变量类(性能)
我想知道在性能方面存储类变量的最佳方式是什么。我的意思是，由于 Children() 函数，存储一个 div id 比查找所有其他类名更好。还是把类名写在变量里比较好？例如这样: var $inne
Cassandra 性能
我已经阅读了所有这些关于 cassandra 有多快的文章，例如单行读取可能需要大约 5 毫秒。到目前为止，我不太关心我的网站速度，但是随着网站变得越来越大，一些页面开始需要相当多的查询，例如一个页
MySQL 性能
最近，我在缓存到内存缓存之前的查询一直需要很长时间才能处理!在这个例子中，它花费了 10 秒。在这种情况下，我要做的就是获得 10 个最近的点击。我感觉它加载了所有 125,592 行然后只返回 1
基本操作的C#性能
我找了几篇文章(包括SA中的一些问题)，试图找到基本操作的成本。但是，我尝试制作自己的小程序，以便自己进行测试。在尝试测试加法和减法时，我遇到了一些问题，我用简单的代码向您展示了这一点
Java远程调试——性能
这个问题在这里已经有了答案: Will Java app slow down by presence of -Xdebug or only when stepping through code? (
Javascript with() 性能
我记得很久以前读过 with() 对 JavaScript 有一些严重的性能影响，因为它可能对范围堆栈进行非确定性更改。我很难找到最近对此的讨论。这仍然是真的吗？最佳答案与其说 with 对性能有
MySQL 性能
我们有一个数据仓库，其中包含非规范化表，行数从 50 万行到 6 多万行不等。我正在开发一个报告解决方案，因此出于性能原因我们正在使用数据库分页。我们的报告有搜索条件，并且我们已经创建了必要的索引，但
mysql - 性能
我有一条有效的 SQL 语句，但需要很长时间才能处理我有一个 a_log 表和一个 people 表。我需要在 people 表中找到给定人员的每个 ID 的最后一个事件和关联的用户。 SELECT
JavaScript 性能
很难说出这里问的是什么。这个问题是含糊的、模糊的、不完整的、过于宽泛的或修辞性的，无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开它，visit the help center 。已关
CSS 性能
通常当我建立一个站点时，我将所有的 CSS 放在一个文件中，并且一次性定义与一组元素相关的所有属性。像这样: #myElement { color: #fff; background-
CSS 性能
两者之间是否存在任何性能差异: p { margin:0px; padding:0px; } 并省略最后的分号: p { margin:0px; padding:0px } 提前致谢!
PHP高精数学-性能
我的应用程序 (PHP) 需要执行大量高精度数学运算(甚至可能出现一共100个数字) 通过这个论坛的最后几篇帖子，我发现我必须使用任何高精度库，如 BC Math 或 GMP，因为 float 类型不
Javamail 性能
我一直在使用 javamail 从 IMAP 服务器(目前是 GMail)检索邮件。 Javamail 非常快速地从服务器检索特定文件夹中的消息列表(仅 id)，但是当我实际获取消息(仅包含甚至不包含
ruby 性能
我非常渴望开发我的第一个 Ruby 应用程序，因为我的公司终于在内部批准了它的使用。在我读到的关于 Ruby v1.8 之前的所有内容中，从来没有任何关于性能的正面评价，但我没有发现关于 1.9 版
redis结构、性能
我是 Redis 的新手，我有一个包含数百万个成员(member) ID、电子邮件和用户名的数据集，并且正在考虑将它们存储在例如列表结构中。我认为 list 和 sorted set 可能最适合我的情

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

c# - 为什么这个添加 SIMD 数组的示例可能无法证明比简单的实现有任何性能提升？