- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我在之前的评论(尤其是@Zboson)之后编辑了我的问题,以获得更好的可读性
我一直遵循并观察到 Openmp 线程的数量应该与机器上的超线程数量大致匹配以获得最佳性能的传统观点。但是,我在配备 Intel Core i7 4960HQ、4 核 - 8 线程的新笔记本电脑上观察到异常行为。 (见 Intel docs here)
这是我的测试代码:
#include <math.h>
#include <stdlib.h>
#include <stdio.h>
#include <omp.h>
int main() {
const int n = 256*8192*100;
double *A, *B;
posix_memalign((void**)&A, 64, n*sizeof(double));
posix_memalign((void**)&B, 64, n*sizeof(double));
for (int i = 0; i < n; ++i) {
A[i] = 0.1;
B[i] = 0.0;
}
double start = omp_get_wtime();
#pragma omp parallel for
for (int i = 0; i < n; ++i) {
B[i] = exp(A[i]) + sin(B[i]);
}
double end = omp_get_wtime();
double sum = 0.0;
for (int i = 0; i < n; ++i) {
sum += B[i];
}
printf("%g %g\n", end - start, sum);
return 0;
}
gcc 4.9-4.9-20140209
编译它时,使用命令:
gcc -Ofast -march=native -std=c99 -fopenmp -Wa,-q
当我更改
OMP_NUM_THREADS
时,我看到了以下性能[这些点是 5 次运行的平均值,误差线(几乎看不到)是标准偏差]:
for i in {1..128}; do
for k in {1..5}; do
export OMP_NUM_THREADS=$i;
echo -ne $i $k "";
./a.out;
done;
done > out
最佳答案
问题可能是由于 clock()
功能。它不会返回 Linux 上的挂钟时间。你应该使用函数omp_get_wtime()
.它比时钟更准确,适用于 GCC、ICC 和 MSVC。事实上,即使我不使用 OpenMP,我也将它用于计时代码。
我在这里用它测试了你的代码
http://coliru.stacked-crooked.com/a/26f4e8c9fdae5cc2
编辑 :要考虑的另一件事可能导致您的问题是 exp
和 sin
您正在使用的函数是在没有 AVX 支持的情况下编译的。您的代码是使用 AVX 支持编译的(实际上是 AVX2)。你可以从 GCC explorer 看到这个如果您使用 -fopenmp -mavx2 -mfma
编译,请使用您的代码每当您从带有 AVX 的代码中调用不支持 AVX 的函数时,您需要将 YMM 寄存器的上部归零或支付大笔罚款。你可以用内在的 _mm256_zeroupper
来做到这一点。 (VZEROUPPER)。 Clang 为您执行此操作,但最后我检查了 GCC 没有,因此您必须自己执行(请参阅此问题的评论 Math functions takes more cycles after running any intel AVX function 以及此处的答案 Using AVX CPU instructions: Poor performance without "/arch:AVX")。因此,由于没有调用 VZEROUPPER,每次迭代都会有很大的延迟。我不确定为什么这对多线程很重要,但如果 GCC 每次启动一个新线程时都这样做,那么它可以帮助解释你所看到的。
#include <immintrin.h>
#pragma omp parallel for
for (int i = 0; i < n; ++i) {
_mm256_zeroupper();
B[i] = sin(B[i]);
_mm256_zeroupper();
B[i] += exp(A[i]);
}
-march=native
来代替编译。不要设置拱门 (
gcc -Ofast -std=c99 -fopenmp -Wa
) 或只使用 SSE2 (
gcc -Ofast -msse2 -std=c99 -fopenmp -Wa
)。
-mvzeroupper
这可能是最方便的解决方案。
This option instructs GCC to emit a vzeroupper instruction before a transfer of control flow out of the function to minimize the AVX to SSE transition penalty as well as remove unnecessary zeroupper intrinsics.
关于multithreading - openmp 并行 for 循环的性能出乎意料的好,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/21960229/
我有2个功能: function func1() while true do -- listen on connection end end function func2()
我的问题可能看起来很奇怪,但我想我正面临着 volatile 的问题。对象。 我写了一个这样实现的库(只是一个方案,不是真正的内容): (def var1 (volatile! nil)) (def
由于 maven 支持多线程构建,是否可以同时运行 Sonar 多线程? (例如 mvn sonar:sonar -T 4 ) 我运行了它,当模块报告成功时,它报告整个构建失败并返回 java.uti
我们正在启动一个网站,该网站在短时间内的交易量非常大。它基本上是在给票。该代码是用Java,Spring和Hibernate编写的。我想通过产生多个线程并尝试使用JUnit测试用例来获取票证来模仿高容
我正在尝试访问像素数据并将图像从游戏中的相机保存到磁盘。最初,简单的方法是使用渲染目标,然后使用RenderTarget-> ReadPixels(),但是由于ReadPixels()的 native
我们有以下系统: 用户数:〜500k 项目数:〜100k UserSimilarity userSimilarity = new TanimotoCoefficientSimilarity(dataM
也许这是一个经常出现的问题,但我需要根据我的上下文进行一些自定义。 我正在使用 Spring Batch 3.0.1.RELEASE 我有一个简单的工作,有一些步骤。一个步骤是这样的 block :
也许这是一个经常出现的问题,但我需要根据我的上下文进行一些自定义。 我正在使用 Spring Batch 3.0.1.RELEASE 我有一个简单的工作,有一些步骤。一个步骤是这样的 block :
我正在尝试使用PyBrain和Python的multiprocessing软件包在Python中训练神经网络。 这是我的代码(它训练了一个简单的神经网络来学习XOR逻辑)。 import pybrai
我有一个繁重的功能,不适合在主时间轴上执行(因为要花很长时间才能完成并使程序崩溃)。 因此我在air(as3)中搜索多线程,但是我发现的所有示例都说明了如何在worker中运行单独的swf文件。如何在
我想实现线程A 和线程B 并行运行并共享全局变量。 下面是用python编写的代码。我想在中执行相同操作Dart (我不想使用future等待,因为它正在等待其他线程完成或必须等待。) 大小写变量:
我的一个项目只适用于调试 DLL,而不适用于非调试 DLL。 在 Debug DLL 设置下发布项目有哪些注意事项?例如,是否丢失了某些优化? 如何通过将调试版本设置为非调试 DLL 来调试此项目?我
我正在尝试比较 Matlab 和 Julia 之间的速度和性能。我正在查看一个代码,该代码对承受给定负载的连续体结构进行拓扑优化。我正在查看的代码是公共(public)代码topopt88.m:htt
Serving Flask 应用程序“服务器”(延迟加载) 环境:生产警告:这是一个开发服务器。不要在生产部署中使用它。请改用生产 WSGI 服务器。 Debug模式:开启 在 http://0.0.
我对 PyQT 很陌生。我正在学习如何制作 Progressbar 并随着算法的进展对其进行更新。我已经能够制作一个使用此链接进行 self 更新的基本进度条:Python pyqt pulsing
我正在尝试指定在特定线程上运行任务,这样我就可以使用两个专用于“放入” channel 的耗时任务的线程,而其他线程则用于处理该任务。 我对如何将特定任务分配给特定线程感到困惑。我以为我可以使用类似
我正在编写一个软件,它对很多(潜在的大)图像进行大量图像操作/合成。 多线程有助于提高速度,但 QT 不允许同时在同一图像上使用多个 QPainter。 所以我必须在副本的每个线程中进行图像操作/合成
此脚本读取 url 文件以执行多线程 HTTP 请求。 如何使用带有 url 的数组来发出多线程请求? 我的阵列将有类似的东西: @array = ("https://example.com/xsd"
Java 文档声明了以下关于构造函数同步的内容: Note that constructors cannot be synchronized — using the synchronized keyw
我有一个程序,其中主线程创建了很多线程。它崩溃了,我正在调试核心文件。崩溃发生在其中一个子线程中。为了找到原因,我需要知道主线程是否还活着。有什么方法可以找出哪个线程是初始线程? 最佳答案 Is th
我是一名优秀的程序员,十分优秀!