algorithm - 计算 __mm256 向量中非零条目数的最快方法是什么？-6ren

algorithm - 计算 __mm256 向量中非零条目数的最快方法是什么？

转载作者：塔克拉玛干更新时间：2023-11-03 02:45:28

25

4

我编写了一种算法，使用英特尔内部函数并行执行多个单精度运算。我的算法每次迭代的结果是单个 256 位向量 (__m256) 中非零条目的数量。

例如:

 00000000  FFFFFFFF  00000000  00000000  00000000  FFFFFFFF  FFFFFFFF  FFFFFFFF

其中迭代的结果是 4。

计算向量中非零项数量的最快方法是什么？

目前我正在做这样的事情:

float results[8];
_mm256_storeu_ps(results, result_vector);

int count = 0;
for (uint32_t idx = 0; idx < 8; ++idx)
{
    if (results[idx] != 0)
    {            
        ++count;
    }
}

这种方法工作得很好，但我想知道是否有更有效的方法，也许是不涉及商店的方法。

最佳答案

硬件 popcnt 指令是您最好的选择。它速度很快，而且 vmovmskps 也非常有效地为您提供每个元素的高位作为整数位掩码。 (compare/movemask 是在矢量比较结果上分支的标准方法，或将其用于 index a lookup table of shuffle masks )。

movemask/popcnt 很有用 when left-packing , 根据您存储的元素数量(洗牌后)增加目标指针。

#include <immintrin.h>

// use only with compare-results.
// or to count elements with their sign-bit set
unsigned count_true(__m256 v) {
    unsigned mask = _mm256_movemask_ps(v);
    return _mm_popcnt_u32(mask);
}

popcnt 有一个独立于 AVX 的功能位，因此理论上可能有一个 CPU(或虚拟机)带有 AVX 但不是硬件 popcnt，但实际上我不会担心的。 (popcnt是SSE4.2引入的，AVX隐含SSE4.2)

即使您希望将结果放入某个向量寄存器中，vmovmskps/popcnt/movd 也可能比水平添加 0/-1 元素更好整数相加。这将需要 3 个洗牌/添加步骤才能将 8 个元素减少到 1 个，并且您将得到一个负数。

我主要提到这一点是因为在某些情况下将比较结果视为整数 0/-1 很有用。例如要有条件地增加计数器向量，cmpps/psubd 就可以了。 (0 + x = x，所以 false 元素不变。)

关于algorithm - 计算 __mm256 向量中非零条目数的最快方法是什么？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/47291702/

25

4

0

文章推荐： jquery - 如何创建一个所有数据都可以被谷歌索引的分页网格？

文章推荐： joomla - Joomla 中的自定义 SEO 文章标题

文章推荐： algorithm - 二进制与线性搜索未排序的 N 个元素

ios - 如何导航回已删除的 PageViewController 条目/更改 PageViewController 条目
情况:我想从数据条目列表导航回我的 PageViewController。 before 和 previous 函数起作用 func pageViewController(pageViewContro
java - 如何避免 Gradle 的 osgi 插件为私有(private)包生成 export-pacakge 条目，为嵌入式依赖项生成 import-package 条目
尊敬的 StackOverflow 用户我有一个 gradle 项目，我想将其工件转换为 osgi 包。在这个包中，我有: 我不想导出的包(可能不会出现在 list 的 Export-Package
android - AlarmManager 条目
我为我的 PendingIntent 设置了一个警报。现在我想在我的 Activity 中显示是否设置了此警报。 Intent service = new Intent(context, MyServ
一个表中最常出现在另一表中的 MYSQL 条目
我有 2 个表、作者和书籍 authors 包含唯一的 IDauthorId 书籍也包含此作为外键我需要知道书籍数量最多的作者。如果 2 个或更多作者并列最多书籍，我需要显示这两位作者我已经能够通
mysql - 根据重复的列值删除行/条目
我有一个名为 prospective_shop 的表，其中一个列名称是“用户名”。用户名未设置为主键，但我想删除所有具有重复用户名的行。我怎样才能以最快的方式做到这一点？我尝试执行以下操作: ALT
android - 如何阅读添加到日历的事件/条目？
我现在可以添加条目了。在我的应用程序中，用户可以在他的日历上输入约会/事件。但在他这样做之前，它应该向他显示他已经添加的事件。它应该从日历中获取事件并将其显示给他。这该怎么做？我被困在这部分。提前致谢
在内核中创建一个简单的只写 proc 条目
#include #include #include #include #include #include char *msg; ssize_t write_proc(struct file
从内核模块创建 sysfs 条目
我想将大于 1024 个字符的字符串传递到我的模块(文件系统)。由于内核参数限制为 1024 个字符，someone recommended改为使用 sysfs。我试图包括 this example
python - SQLAlchemy:相关子查询中仍然存在 FROM 条目
我正在尝试使用 SQLAlchemy 构建以下查询(用作包含查询的子查询，该查询定义名为 tbl_outer 的别名): SELECT max(tbl.ts) AS max_1 FROM tbl WH
Java - 仅比较特定键的两个 Maps 条目
假设我有两张 map : Map map1 = Map.of( "a", "1", "b", "2", "c", "3", "x
VBA:从每个类别中提取前 'x' 条目
通过简化示例，假设您有以下数据集: A B C Name Group Amount Dave A 2 Mike B 3 Adam C 4
apache - 三级域的 DNS 条目
我正在尝试在我的服务器上创建一个三级域虚拟主机。我希望配置设置正确，但我得到一个 ERR_NAME_NOT_RESOLVED错误。我已经读到我必须在某处“添加 DNS 条目”以便解析名称，但我该怎么
regex - 我可以使用什么正则表达式来查找逗号分隔列表中的 Nᵗʰ 条目？
我需要一个可用于在逗号分隔列表中查找第 N 个条目的正则表达式。例如，假设此列表如下所示: abc,def,4322,mail@mailinator.com,3321,alpha-beta,43 .
GWT .hgignore/.gitignore 条目
GWT 应用程序(在 Eclipse 中开发)的源代码管理忽略文件中的典型条目是什么？最佳答案我会推荐: 你leave the eclipse files (.project, .classpat
sql - 需要帮助为没有订单的月份生成 NULL 条目
我必须创建显示表 (Tbl) 中所有字段的输出，并创建一个额外的列来按月计算每个客户的累计总和(例如，如果客户在 4 月份有两次销售，新列将具有这些销售额和两行中任何先前销售额的总和)。我能做的就这么
docker - 使用从属性文件创建的 ConfigMap 条目
文档 ( http://kubernetes.io/docs/user-guide/configmap/ ) 上用于使用值的示例基于 ConfigMap，其中每个数据条目都是一对/值。例子: apiV
autohotkey - 创建以冒号结尾的 AutoHotkey 条目
我有一个奇怪的错字，我一遍又一遍地犯，而不是实际工作我的打字技巧，我想编辑我的 AutoHotkey 脚本来弥补这一点。有时，当我输入大写字母时，我会点击:按钮并输入“I:”，我希望 AHK 仅用字
x86 - 初始加载后如何更新 GDT 条目？
使用 lgdt 初始化 GDT 并将其加载到 GDTR 后，稍后如何更新 GDT？如果我使用 sgdt 命令获取基地址，然后更新或添加条目，然后使用 lgdt 再次重新加载，我是否正确？还有其他方法
c# - 条目(数据库)已添加
我有两个应用程序共享同一个数据库，即 API 和 MVC5 应用程序。两者都在本地主机上运行良好，但在部署到我的 Azure 帐户时出现此错误 Configuration Error Descrip
powershell - 从数组中删除 'lesser' 条目
我正在尝试修剪我拥有的一些文件。我将为您保存到目前为止我编写的野兽，并通过提供虚构代码使其保持简单。让我们来看看这个数组: [System.String[]]$Collection = 'Invit

首页

博学

6Ren·AI

商城

algorithm - 计算 __mm256 向量中非零条目数的最快方法是什么？