c - 程序何时会受益于预取和非临时加载/存储？-6ren

c - 程序何时会受益于预取和非临时加载/存储？

转载作者：太空狗更新时间：2023-10-29 16:44:49

26

4

我用这个做了测试

    for (i32 i = 0; i < 0x800000; ++i)
    {
        // Hopefully this can disable hardware prefetch
        i32 k = (i * 997 & 0x7FFFFF) * 0x40;

        _mm_prefetch(data + ((i + 1) * 997 & 0x7FFFFF) * 0x40, _MM_HINT_NTA);

        for (i32 j = 0; j < 0x40; j += 0x10)
        {
            //__m128 v = _mm_castsi128_ps(_mm_stream_load_si128((__m128i *)(data + k + j)));
            __m128 v = _mm_load_ps((float *)(data + k + j));

            a_single_chain_computation

            //_mm_stream_ps((float *)(data2 + k + j), v);
            _mm_store_ps((float *)(data2 + k + j), v);
        }
    }

结果很奇怪。

无论 a_single_chain_computation 花费多少时间，加载延迟都不会隐藏。
而且，随着计算量的增加，额外的总时间也会增加。 (对于单个 v = _mm_mul_ps(v, v)，预取节省了大约 0.60 - 0.57 = 0.03s。对于 16 个 v = _mm_mul_ps(v, v)，它节省大约 1.1 - 0.75 = 0.35 秒。为什么？)
无论有无预取，非临时加载/存储都会降低性能。 (我能理解负载部分，但为什么存储也一样？)

最佳答案

你需要在这里分开两个不同的东西(不幸的是它们有一个相似的名字):

非临时预取 - 这将预取该行，但当它填满缓存时将其写为最近最少使用的行，因此当您下次使用同一组时，它将成为第一个被逐出的行。这让您有足够的时间来实际使用它(除非您非常不幸)，但不会浪费超过该集合的一种方式，因为下一个预取将取代它。顺便说一句，关于你上面的评论 - 每次预取都会污染 L3 缓存，它是包容性的，所以你不能没有它。
非临时(流式)加载/存储 - 这也不会污染缓存，但使用完全不同的机制使它们不可缓存(以及写入组合)。这确实会对性能产生影响即使您真的不再需要这些行，因为可缓存的写入可以在缓存中保持缓冲直到被驱逐，所以您没有马上写出来。使用 uncacheables 你可以，在某些情况下它可能会干扰你的 mem BW。另一方面，您可以获得写组合和弱排序的好处，这可能会给您带来一些优势。这里的底线是只有在它有帮助时才应该使用它，不要假设它会神奇地提高性能(现在没有人这样做......)

关于您的问题-

您的预取应该有效，但还不足以产生影响。尝试用更大的数字替换 i+1。实际上，甚至可以扫一扫，看看您应该提前查看多少元素会很有趣。
我猜这与 1 相同 - 有 16 个 muls，您的迭代足够长以进行预取
正如我所说 - 您的存储将无法在较低级别的缓存中进行缓冲，并且必须刷新到内存中。这是流媒体商店的缺点。当然，它是特定于实现的，因此它可能会有所改进，但目前并不总是有效。

关于c - 程序何时会受益于预取和非临时加载/存储？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/17312823/

26

4

0

文章推荐： c - 枚举名称有什么作用？

文章推荐： c - 优化的 strcmp 实现

文章推荐： Javascript - 使用 Intl 获取当前语言环境以显示时间和日期

r - (预)向函数工厂和内部提供变量
我正在阅读哈德利的 Advanced R并尝试一些东西。我正在尝试创建一个 lazy闭包函数返回一个带有提供的函数 data.frame在其环境中以及使用 with并且能够在以后提供额外的函数参数。
ios - Swift:(预)从initialViewController加载UIWebView
我有两个 ViewController。初始 ViewController 是输入和存储 URL 的地方。此初始 ViewController 的 viewDidLoad 还应该在应用程序启动时开始加
android - state_activated 预 hive
你是怎么用的对于应用程序中的 ListView 项也应该在设备 <11 上运行？由于 activated_state 在 HC 之前不可用，我只能想到两个肮脏的解决方法: 在您的 Activit
android - ActionBar 预 hive
我正在为 android (2.1 > 3.1) 编写一个应用程序，我想使用熟悉的做法，即在 Honeycomb 应用程序中使用应用程序图标来进入家庭 Activity ，但是，当我之前运行该 Act
Redis 预 GET 事件
如果搜索的键不存在，我如何覆盖方法 GET 或编写一个将在服务器端执行的新函数返回另一个键值？示例: 如果关键字“word_1 word_2 word_3 word_4”不存在则搜索关键字“word
Git 预 merge Hook ？
对于我的存储库，我使用的是 Git 和 Stash。在 Stash 端，我限制了(只读)对 master 的访问权限，因此任何用户都可以从 master 分支分支以获取功能/分支，但不能直接 merg
select - Dojo dgrid :(预)在渲染中选择行
如何配置dgrid及其存储以定义渲染行时是否已经选择了行？例如，如果我的行数据是这样的： { id: 1, name: 'Item Name', selected: true } 我当前
JMeter - 使用来自其他 BeanShell 预/后处理器的变量？
有没有一种方法可以将变量从一个 BeanShell 前/后处理器引用到另一个 BeanShell 处理器(它们在同一个线程组中)？如果我在 HTTP 请求下的 BeanShell 预处理器中创建了一
ios - Xcode 预 ActionScript 不起作用？
问题我已尝试添加预操作 shell 脚本，这些脚本会根据我正在构建的内容打开/关闭我的 .pch 文件中的某些定义。但是，在运行构建时，没有任何反应。我不是一个流利的 shell 脚本编写者，所以
javascript - 避免 jQuery(预)加载图像
我有一个 HTML 字符串用作 jQuery 输入文档。 // the variable html contains the HTML code jQuery( html ).find( 'p' ).
c - Mercurial 预 merge 钩子(Hook)
在 Mercurial 中允许 merge 之前有没有办法进行一些检查？通过将以下内容添加到 ~/.hg/hgrc，我找到了更新前 Hook ，并拥有一个在允许更新之前运行的脚本: [hooks]
php - CodeIgniter(预 Controller ) Hook 和缓存
总结: 预 Controller Hook 是否在缓存期间执行？是否有任何 Hook 点可以执行？ (系统前？) 我应该强调一个事实，即 Hook 不会影响发送到浏览器的内容。这不是问题。详细版:
android - Skobbler Android 预 bundle 错误
我正在使用适用于 android 的 Skobbler Map API，到目前为止它一直非常好。按照官方的“操作方法”，我已经能够将 map 应用到我的应用程序中。比我可以让应用程序下载 map 并离
javascript - Node 预 gyp 安装 --fallback-to-build
当我安装bcrypt时我的 hapi js 项目的模块尚未安装，它显示类似 node-pre-gyp install --fallback-to-build 我尝试通过运行来安装； npm i nod
java - 编写任务执行(预/后)脚本 [Gradle + IntelliJ]
我试图使用此代码的变体: apply plugin: 'java' apply plugin: 'idea' idea.workspace.iws.withXml { provider ->
php - 如何防止 PHP namespace 冲突(预 bundle )
假设我们有一个 PHP 项目，其依赖项 A 和 B 分别依赖于 PHP 库 X，但版本不同。通常，人们会使用诸如 composer 之类的 PHP 依赖管理器，它可以通过在与 A 和 B 兼容的版本
formatting - 如何在代码/预 block 中添加 Markdown 格式？
这似乎违背了代码块的目的，但我希望能够在代码块中加粗。例如，如果我想将返回行加粗: int main(void) { **return 0;** } 最佳答案您必须在 HTML 中执行此操作
deep-learning - 我们是否应该使用 Huggingface(预)训练一个 BERT 无框模型的小写输入数据？
我们是否应该使用 Huggingface(预)训练一个 BERT 无框模型的小写输入数据？我查看了 Thomas Wolf ( https://github.com/huggingface/trans
javascript - Mongoose 预 Hook : pull _id from array on remove
我有两个模式: 技能: var mongoose = require("mongoose"); var SkillSchema = new mongoose.Schema({ skill: {
html - Angular2 的 IE 11 预 Bootstrap 加载屏幕
我这里有问题。这适用于 Chrome，但我无法在 IE11 的 index.html 中使用任何动画。当它不想工作时，我会看到一个静态屏幕。同样在 IE 中，消息不会像它应该的那样消失。如果我将 di

首页

博学

6Ren·AI

商城

c - 程序何时会受益于预取和非临时加载/存储？