c - AVX512 位测试和操作性能建议-6ren

c - AVX512 位测试和操作性能建议

转载作者：行者123 更新时间：2023-11-30 16:55:11

我遇到了一组使用以下“内核”作为性能阻止程序的代码。由于我可以使用最新的 Intel(R) Xeon Phi(TM) CPU 7210 (KNL)，因此我希望使用 AVX512 内在函数来加快速度。

for( int y = starty; y <= endy; y++)
{
    // hence data[][] is "unsigned char" while result[] is "int"
    for( int x = startx; x <= endx; x++)
    {
        if( (data[y][x]&0x1) == 0 )
            result[x] += data[y][x];
    }
}

分析代码的行为后，我发现内循环的长度大多小于16，因此我编写了以下内容

register int xlen = xend - xstart + 1;

__m512i zero5 = _mm512_setzero_si512();
__m256i zero2 = _mm512_castsi512_si256(zero5);
__m128i zero1 = _mm512_castsi512_si128(zero5);
__m256i mask2 = _mm256_set1_epi8(0x1);
__m128i mask1 = _mm256_castsi256_si128(mask2);

register __m512i psprof0 = zero5;

for( int i = 0; i < (16-xlen)&(~0x1); i += 2 ) mask1 = _mm_srli_si128(mask1, 2);
if( (16-xlen)&(0x1) ) mask1 = _mm_srli_si128(mask1, 1);

#pragma vector nontemporal
#pragma prefetch data
for( int y = starty; y <= endy; y++ )
{
    __m128i pixel16  = _mm_loadu_si128((__m128i*)&data[y][startx]);

    // if ( _mm_testc_si128(pixel16, mask1) ) continue;

    __m128i mask16    = _mm_andnot_si128(pixel16, mask1);
    __m128i pixel16n  = _mm_sign_epi8(pixel16, mask16);
            psprof0   = _mm512_add_epi32(psprof0, _mm512_cvtepu8_epi32(pixel16n));
}

_mm512_storeu_si512(&result[startx], psprof0);

有几个问题:

由于_mm_srli_si128不接受非立即参数，我必须在那里使用循环，请问有什么办法可以消除它吗？
_mm_testc_si128(pixel16, mask1) 大多对性能没有帮助，这当然是由于 data[][] 的分布造成的；但是，它“计算 a 的按位 NOT，然后与 b 进行 AND，如果结果为零，则将 CF 设置为 1，否则将 CF 设置为 0”，有没有办法获得“ANDNOT”的结果，以便我这样做不需要再次计算_mm_andnot_si128吗？
由于内环长度大多小于16，可能不太适合AVX512；然而，通过加载 data[y][x] 和 data[y+1][x]，然后将它们组合成一个 __m256i ，将 y 间隔展开 2 值得吗？但是，由于 KNL(AVX512BW)尚不支持 8 位 int 到 16 位 int 的转换，因此可能比当前版本更令人沮丧。
一般来说，任何有关提高 KNL 上这一小段代码性能的建议/建议都会受到高度赞赏:)(它已经位于 OpenMP 循环区域内，因此现在可能不可用)

上面第 3 点:

static inline __m256i vec_256_combine_128(__m128i a, __m128i b)
{
// combine two __m128i into one __m256i
return _mm256_insertf128_si256(_mm256_castsi128_si256(a), b, 1);
}

static inline __m128i vec_256_add_128(__m256i a)
{
// add lower 128bit and higher 128bit of __m256i consists of epi16
return _mm_add_epi16(_mm256_castsi256_si128(a), _mm256_extracti128_si256(a, 1));
} 

for( int y = starty; y <= endy; y += 2 )
{
    __m128i pixel16a  = _mm_load_si128((__m128i*)&pEdgeImage[y][sx]);
    __m128i pixel16b  = _mm_load_si128((__m128i*)&pEdgeImage[y+1][sx]);
    if ( y == ye ) 
        pixel16b  = zero1;  

    __m256i pixel16   = vec_256_combine_128(pixel16a, pixel16b);

    if ( _mm256_testc_si256(pixel16, mask1) ) continue;

    __m256i mask16    = _mm256_andnot_si256(pixel16, mask1);
    __m256i pixel16n  = _mm256_sign_epi8(pixel16, mask16);

    __m256i pixel16lo = _mm256_unpacklo_epi8(pixel16n, zero2);
    __m256i pixel16hi = _mm256_unpackhi_epi8(pixel16n, zero2);

            psprof0   = _mm256_add_epi16(psprof0, vec_256_combine_128(vec_256_add_128(pixel16lo), vec_256_add_128(pixel16hi)));
}

最佳答案

这是一个线性版本，它返回标准化位计数(8 个浮点)，其中按条目数进行标准化。 (用手戳进去，很可能有一两个错字)

PURE FUNCTION BITS8(nGot, DataIn, nBits) BIND(C, NAME='BITS8')
USE OMP_LIB
USE, INTRINSIC :: IOS_C_BINDING, ONLY: C_FLOAT, C_INT8_Y, C_INT
IMPLICIT NONE
INTEGER(C_INT)                    , INTENT(IN) :: nGot
INTEGER(C_INT8_T)                 , INTENT(IN) :: nBits !Which should come in as 8
INTEGER(C_INT8_T), DIMENSION(nGot), INTENT(IN) :: DataIn
!DIR$ ATTRIBUTES ALIGN : 64                    :: Bits
REAL(C_FLOAT), DIMENSION(nBits)                :: Bits8

Bits8 = 0.0E0

!DIR$ ASSUME_ALIGNED DataIn:2
!DIR$ PREFETCH       DataIn:1:64
Sum_Loop: DO I = 1, nGot
!$OMP SIMD REDUCTION(+:Bits8) LINEAR(DataIn) SAFELEN(64)
  Bit_Loop: DO J = 0, nBits-1
    Bits8(J+1) = IBITS(DataIn(I),J, 1) + Bits8(J+1)
  ENDDO Bit_Loop
ENDDO Sum_Loop
!$OMP END

!DIR$ SIMD
Norm_Loop: DO J = 1, nBits
  Bits8(J) = Bits8(J)/nGot
ENDDO Norm_Loop

RETURN
END FUNCTION Bits8

你用“ifort -openmp -O3”等编译它。显然，对于 2 数组，您将需要 # 行和 # 列，以及要检查的行和列的开头和结尾所在的位置。我相信您知道 C 语言和 Fortran 语言中的行和列是相反的。

要计算出尾部下划线戏剧，请在 .o 文件上使用“nm”，并且 BIND(C, NAME=) 也可以提供帮助。

也许你可以使用更精简的东西，然后在你的 C 中内联函数，并将 SIMD REDUCTION 放在 C 端。如果您在“c 侧”处理数组，则您的优点是不必担心行/列差异。

PURE FUNCTION BITS8(DataIn) BIND(C, NAME='BITS8')
USE OMP_LIB
USE, INTRINSIC :: IOS_C_BINDING, ONLY: C_INT8_T, C_INT
IMPLICIT NONE
INTEGER(C_INT8_T), PARAMETER      :: nBits = 8
INTEGER(C_INT8_T)    , INTENT(IN) :: DataIn
INTEGER(C_INT), DIMENSION(nBits)  :: Bits8

! Bits = 0.0E0

!DIR$ ASSUME_ALIGNED DataIn:2
!DIR$ PREFETCH       DataIn:1:64
Bit_Loop: DO J = 0, nBits-1
  Bits8(J+1) = IBITS(DataIn(I),J, 1)
ENDDO Bit_Loop
!$OMP END

RETURN
END FUNCTION Bits8

另一种方式是这样的:

PURE FUNCTION BITS8(nrows, ncols, startrow, startCol, EndRow, EndCol, DataIn) BIND(C, NAME='BITS8')
USE OMP_LIB
USE, INTRINSIC :: IOS_C_BINDING, ONLY: C_FLOAT, C_INT8_Y, C_INT
IMPLICIT NONE
INTEGER(C_INT8_T)                  , PARAMETER        :: nBits = 8
INTEGER(C_INT)                           , INTENT(IN) :: nRows
INTEGER(C_INT)                           , INTENT(IN) :: nCols
INTEGER(C_INT)                           , INTENT(IN) :: StartRow
INTEGER(C_INT)                           , INTENT(IN) :: StartCol
INTEGER(C_INT)                           , INTENT(IN) :: EndRow
INTEGER(C_INT)                           , INTENT(IN) :: EndCol
INTEGER(C_INT8_T), DIMENSION(ncols,nrows), INTENT(IN) :: DataIn
!DIR$ ATTRIBUTES ALIGN : 64                           :: Bits8
INTEGER(C_INT), DIMENSION(nBits)                      :: Bits8
INTEGER(C_INT)                                        :: I, J, K

!DIR$ ASSUME_ALIGNED DataIn:64
Bits8 = 0

Row_Loop: DO J = StartCol, EndCol
!DIR$ PREFETCH       DataIn:1:64
  Col_Loop: DO I = StartRow, EndRow
    !$OMP SIMD REDUCTION(+:Bits8) LINEAR(DataIn) SAFELEN(64)
    Bit_Loop: DO K = 0, nBits-1
      Bits8(K+1) = IBITS(DataIn(I,J),K, 1) + Bits8(K+1)
    ENDDO Bit_Loop
  ENDDO Sum_Loop
ENDDO Sum_Loop
!$OMP END

RETURN
END FUNCTION Bits8

除此之外，我认为您的 data[y][x]&0x1 应该能够与某些 #pragma vector always 或 #pragma simd (等)一起使用... -vec-report 3 应该允许您使用它出来。

如果没有，那么内联的小部分可能是最好的？

我不知道您需要什么，但在第一个示例中，我在单核上获得了 >250 MB/秒的位吞吐量...所以您知道会发生什么。

我非常确信最好的方法就是对数据进行直方图绘制。然后对每个直方图索引值进行位测试，并乘以该箱的直方图箱计数。当然，对于较大的计数值，它会更快。一旦您知道每个直方图索引的位模式，该部分就永远不会改变。因此，对于较大的“求和计数”和较小的“字节大小”，这肯定会更快。对于小计数大小和 64 位或更大，使用 IBITS 可能会更快。

9 月 16 日左右的英特尔网络研讨会上介绍了直方图(c 和 fortran)。

Fortran 的一个优点是，对于单个字节，可以将直方图的尺寸设置为 (-128:128)，这使得可以直接将值放入正确的容器中。

关于c - AVX512 位测试和操作性能建议，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/40371478/

文章推荐：将 unsigned long long 的最低字节复制到 C 中的数组

文章推荐： c# - 使用 Matrox 命令捕获帧

文章推荐： c - (posix)消息队列有读写器原理吗？

.NET 开发人员开始社交网站，建议？
我是一个相对较新的程序员； CS 学士学位，大学毕业大约 2 年，主要使用 C# 中的 .NET。我对 SQL 交互/脚本编写相当流利，并且对 ASP.NET 做了一些工作(主要是维护现有站点)。我
opencv - 动态视频流分析 - 建议？
我计划开发一个简单的解决方案，使我能够即时执行非常基本的视频流分析。我以前从未做过类似的事情，因此这是一个非常笼统和开放的问题。主要重点是检查流是否正常运行，例如 - 卡住帧、黑屏以及音频是否存在。同
关于大型项目的版本控制和避免包含表达式的版本的 Maven 建议
我正在考虑重组一个大型 Maven 项目...... 我们当前结构的基本概述: build [MVN plugins, third party dependency management]:5.1
sql - 查询调优 - 建议
我需要有关附加查询的建议。该查询执行了一个多小时，并根据解释计划进行了全表扫描。我对查询调优还很陌生，希望得到一些建议。首先，为什么我要进行全表扫描，即使我使用的所有列都在其上创建了索引。其次，有
mysql - 一个疯狂的数据库结构 - 建议
我正在做一个项目，我需要在 4 个模型之间创建三个多对多关系。这是它的过程: 常见问题类别可以有许多常见问题子类别，反之亦然。常见问题组可以有许多常见问题的子类别，反之亦然。常见问题可以有许多常见
embedded - 小型嵌入式合成语音库/建议
对于代码大小比语音质量更重要的 PIC 和/或 ARM 嵌入式系统，是否有任何易于使用的免费或廉价的语音合成库？现在似乎 1 meg 的封装被认为是“紧凑的”，但很多微 Controller 都比它小
具有多个有效负载的 Solr 建议
我们正在使用 Solr 建议器功能进行 businessName 查找。当用户输入查询以及匹配的名称时，我们希望 solr 发送来自个人资料的其他属性，如 id、地址、城市、州、国家等字段。我尝试使
Delphi:建议，构建用户界面的想法
我正在构建一个用户界面。我的计划将包括 4 个主要部分: 1) 顶部菜单 - TMainMenu。一个窗口的顶部 2) 主菜单 - TTreeView。一个窗口的左边。 TreeView的每一项=对应
sharepoint - 需要技术推荐/建议
我的公司需要一个任务管理系统来处理从“为X购买一台计算机”到“将一个人转移到另一个国家”这样简单的场景。简单的场景是由一个人处理的单个任务，而更大的任务可以分解为在工作流程中委派给多个人的多个子任务。
marklogic - 内存使用规划 - 建议？
MarkLogic 服务器的林大小与实际内存的建议比率是多少？例如，我目前有一个 190GB 的数据库，并且该数据库随着时间的推移而不断增长。由于数据库会不断增长，我最终需要对该数据库进行集群。因此，
audio - 关于如何解码数据包的线索，建议
去年我收到了一个礼物，它是一个索尼 CMT700Ni 音频站，支持 wifi。它还具有类似于广播的功能，称为“PartyStreaming”。我目前正在挖掘内部，探索它，所以也许我可以结束拥有自己的“
nlp - 如何选择特征选择算法？ - 建议
有没有我可以阅读的研究论文/书籍可以告诉我针对手头的问题哪种特征选择算法最有效。我试图简单地将 Twitter 消息识别为 pos/neg(首先)。我从基于频率的特征选择开始(从 NLTK 书开始)
.net - 需要技术推荐/建议
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。要求我们推荐或查找工具、库或最喜欢的场外资源的问题对于 Stack Overflow 来说是偏离主题的，
java - jUnit - 建议
我正在浏览 stackoverflow 以查找有关使用 jUnit 进行测试的常见建议，但仍然有几个问题。我知道，如果要测试的方法很复杂，最好的方法是将其分成小的单独部分并测试每个部分。但问题是 -
Java Collection 建议
我有一个方法如下 public List> categorize(List customClass){ List> returnValue = new ArrayList<>();
svn - 需要关于使用分支和合并回主干的帮助/建议
我的问题是，当按照下面的程序合并时，在最佳实践场景中，“将分支折叠回主干”程序的最后一步是正确的方法吗？我已经使用 svn 很多年了。在我的个人项目中，我总是毫不犹豫地在主干上愉快地进行修改，并且在
iphone - UINavigationController 建议
我读过 UINavigationController当您想从 n 个屏幕跳转到第一个屏幕时，这是最佳选择。这样做需要以下代码: NSMutableArray *array=[[NSMutableArr
java - 文件输入帮助/建议
我有一个文件输入类。它在构造函数中有一个字符串参数来加载提供的文件名。但是，如果文件不存在，它就会退出。如果文件不存在，我希望它输出一条消息 - 但不确定如何...... 这是类(class): pu
flash - 交互式世界地图 - 建议？
我希望创建一个“您访问过的国家/地区” map - 就像您可能在 Facebook、TravelAdvisor 和诸如此类的网站上看到的那样。我尝试过不同的闪光灯套件，但它们并不像我希望的那样先进。
Perl 建议 - 接收文件并更改内容
我需要一些关于如何处理我想用 Perl 编写的脚本的建议。基本上我有一个看起来像这样的文件: id: 1 Relationship: "" name: shelby pet: 1

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

c - AVX512 位测试和操作性能建议