- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我目前正在研究 C 语言的优化,并且过去有一项任务是优化一段代码。在其他优化(展开循环和强度降低)中,我根据缓存大小使用了阻塞(遵循英特尔关于此事的教程):
现在我想我明白了为什么这种技术在那种情况下有效,在步幅为 1 的情况下,它会将 block 加载到缓存中并减少访问内存中下一个位置时的未命中数。但在我的代码中,dst[dim * jj + ii]
似乎到处跳来跳去,因为它在最内层的循环中乘以 jj
。缓存如何解决这个问题? dim 乘以 0 然后 1 然后 2 等在某个时候它会超过 block 可以容纳的东西并且优化将毫无意义。我的理解对吗?
然而,在实践中,当我只对 jj
变量使用阻塞时,我并没有像在 ii
和jj
。所以我让它更快但不知道为什么。作业已经过去了,但我仍然不明白,这很令人沮丧。在此先感谢您容忍这个可能非常愚蠢的问题。
void transpose(int *dst, int *src, int dim)
{
int i, j, dimi, jj,ii;
dimi = 0;
for(i=0; i < dim; i+=block_size)
{
for(j=0; j<dim; j+=block_size)
{
for(ii = i; ii < i+block_size; ii++)
{
dimi = dim * ii;
for(jj = j; jj < j+block_size; jj++)
{
dst[dim*jj + ii] = src[dimi + jj];
}
}
}
}
}
最佳答案
dst
中的空间局部性很差,但是对于两个维度都进行了阻塞,在时间和空间上仍然有足够的局部性,因此当您存储下一个 时,缓存行通常在 L1d 缓存中仍然很热>int
.
假设 dst[dim*jj + ii]
是缓存行中的第一个 int
。 dst[dim*jj + ii + 1]
的存储将在同一缓存行中。如果该行在 L1d 缓存中仍然很热,则 CPU 没有花费任何带宽来驱逐脏行 do L2,然后将其带回 L1d 以进行下一次存储。
对于两个维度的阻塞,下一次存储将在 block_size
更多存储到 dst[ dim*(jj+1..block_size-1) + ii ]
之后发生. (ii
循环的下一次迭代。)
如果 dim
和 block_size
都是 2 的幂,该行可能会因为冲突而被逐出。相距 4kiB 的地址进入 L1d 中的同一组,尽管 L2 的问题步幅更大。 (Intel 的 L1d 缓存是 32kiB 和 8 路集合关联的,因此同一个集合中再多 8 个存储可能会逐出一行。但是 L3 缓存使用散列函数进行集合索引,而不是使用范围的简单模数地址位直接。IDK 你的缓冲区是多少位,或者你的整个矩阵可以在你的 L3 缓存中保持热。)
但是如果 dim
或 block_size
不是 2 的幂,那么所有 64 组 8 行 64 字节 (L1d) 都会起作用。因此 L1d 缓存中最多可能有 64*8 = 512 个脏行。但请记住,仍然有数据按顺序加载,这会占用一些空间。 (不多,因为您从每行加载的数据中连续读取 16 个整数,并使用它来弄脏 16 个不同的目标数据行。)
仅在 1 维中进行阻塞,在返回目标行之前您要进行更多存储,因此到那时它可能已被逐出到 L2 或 L3。
顺便说一句,我将您的代码放在 Godbolt 编译器资源管理器 ( https://godbolt.org/g/g24ehr ) 上,而 x86 的 gcc -O3
不会尝试做任何特别的事情。它使用 vector 加载到 XMM 寄存器中,并通过随机播放解包并进行 4 次独立的 int
存储。
clang6.0 做了一些有趣的事情,包括复制一个 256 字节的 block 。 IDK 如果它这样做是为了解决别名问题(因为没有 int *restrict dst
它不知道 src 和 dst 不重叠)。
顺便说一句,连续写入和分散读取可能会更好。 (即反转你的内部两个循环,所以 ii
在最里面的循环而不是 jj
中改变)。逐出脏缓存行比逐出干净的行并稍后重新读取它的代价更高。
关于c - 通过 C 中的循环阻塞进行优化,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/50671488/
#include using namespace std; class C{ private: int value; public: C(){ value = 0;
这个问题已经有答案了: What is the difference between char a[] = ?string?; and char *p = ?string?;? (8 个回答) 已关闭
关闭。此题需要details or clarity 。目前不接受答案。 想要改进这个问题吗?通过 editing this post 添加详细信息并澄清问题. 已关闭 7 年前。 此帖子已于 8 个月
除了调试之外,是否有任何针对 c、c++ 或 c# 的测试工具,其工作原理类似于将独立函数复制粘贴到某个文本框,然后在其他文本框中输入参数? 最佳答案 也许您会考虑单元测试。我推荐你谷歌测试和谷歌模拟
我想在第二台显示器中移动一个窗口 (HWND)。问题是我尝试了很多方法,例如将分辨率加倍或输入负值,但它永远无法将窗口放在我的第二台显示器上。 关于如何在 C/C++/c# 中执行此操作的任何线索 最
我正在寻找 C/C++/C## 中不同类型 DES 的现有实现。我的运行平台是Windows XP/Vista/7。 我正在尝试编写一个 C# 程序,它将使用 DES 算法进行加密和解密。我需要一些实
很难说出这里要问什么。这个问题模棱两可、含糊不清、不完整、过于宽泛或夸夸其谈,无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开,visit the help center . 关闭 1
有没有办法强制将另一个 窗口置于顶部? 不是应用程序的窗口,而是另一个已经在系统上运行的窗口。 (Windows, C/C++/C#) 最佳答案 SetWindowPos(that_window_ha
假设您可以在 C/C++ 或 Csharp 之间做出选择,并且您打算在 Windows 和 Linux 服务器上运行同一服务器的多个实例,那么构建套接字服务器应用程序的最明智选择是什么? 最佳答案 如
你们能告诉我它们之间的区别吗? 顺便问一下,有什么叫C++库或C库的吗? 最佳答案 C++ 标准库 和 C 标准库 是 C++ 和 C 标准定义的库,提供给 C++ 和 C 程序使用。那是那些词的共同
下面的测试代码,我将输出信息放在注释中。我使用的是 gcc 4.8.5 和 Centos 7.2。 #include #include class C { public:
很难说出这里问的是什么。这个问题是含糊的、模糊的、不完整的、过于宽泛的或修辞性的,无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开它,visit the help center 。 已关
我的客户将使用名为 annoucement 的结构/类与客户通信。我想我会用 C++ 编写服务器。会有很多不同的类继承annoucement。我的问题是通过网络将这些类发送给客户端 我想也许我应该使用
我在 C# 中有以下函数: public Matrix ConcatDescriptors(IList> descriptors) { int cols = descriptors[0].Co
我有一个项目要编写一个函数来对某些数据执行某些操作。我可以用 C/C++ 编写代码,但我不想与雇主共享该函数的代码。相反,我只想让他有权在他自己的代码中调用该函数。是否可以?我想到了这两种方法 - 在
我使用的是编写糟糕的第 3 方 (C/C++) Api。我从托管代码(C++/CLI)中使用它。有时会出现“访问冲突错误”。这使整个应用程序崩溃。我知道我无法处理这些错误[如果指针访问非法内存位置等,
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 我们不允许提问寻求书籍、工具、软件库等的推荐。您可以编辑问题,以便用事实和引用来回答。 关闭 7 年前。
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。 要求我们推荐或查找工具、库或最喜欢的场外资源的问题对于 Stack Overflow 来说是偏离主题的,因为
我有一些 C 代码,将使用 P/Invoke 从 C# 调用。我正在尝试为这个 C 函数定义一个 C# 等效项。 SomeData* DoSomething(); struct SomeData {
这个问题已经有答案了: Why are these constructs using pre and post-increment undefined behavior? (14 个回答) 已关闭 6
我是一名优秀的程序员,十分优秀!