- android - RelativeLayout 背景可绘制重叠内容
- android - 如何链接 cpufeatures lib 以获取 native android 库?
- java - OnItemClickListener 不起作用,但 OnLongItemClickListener 在自定义 ListView 中起作用
- java - Android 文件转字符串
我在 scicomp 上遇到了这个问题这涉及计算总和。在那里,你可以看到 c++和类似的 fortran执行。有趣的是,我看到 Fortran 版本的速度提高了大约 32%。
我想,我不确定他们的结果,并试图重振局面。这是我运行的(非常轻微的)不同代码:
C++
#include <iostream>
#include <complex>
#include <cmath>
#include <iomanip>
int main ()
{
const double alpha = 1;
std::cout.precision(16);
std::complex<double> sum = 0;
const std::complex<double> a = std::complex<double>(1,1)/std::sqrt(2.);
for (unsigned int k=1; k<10000000; ++k)
{
sum += std::pow(a, k)*std::pow(k, -alpha);
if (k % 1000000 == 0)
std::cout << k << ' ' << sum << std::endl;
}
return 0;
}
语言
implicit none
integer, parameter :: dp = kind(0.d0)
complex(dp), parameter :: i_ = (0, 1)
real(dp) :: alpha = 1
complex(dp) :: s = 0
integer :: k
do k = 1, 10000000
s = s + ((i_+1)/sqrt(2._dp))**k * k**(-alpha)
if (modulo(k, 1000000) == 0) print *, k, s
end do
end
我在 Ubuntu 12.04 LTS
机器上使用 gcc 4.6.3
和 clang 3.0
编译上述代码,所有代码都带有 -O3
标志。这是我的时间安排:
time ./a.out
gfortran
real 0m1.538s
user 0m1.536s
sys 0m0.000s
g++
real 0m2.225s
user 0m2.228s
sys 0m0.000s
clang
real 0m1.250s
user 0m1.244s
sys 0m0.004s
有趣的是,当使用 gcc
时,我还可以看到 fortran
代码比 c++
快大约相同的 32%。但是,使用 clang
,我可以看到 c++
代码实际上运行速度提高了大约 19%。这是我的问题:
clang
在这里做得这么好?是否有用于 llvm 编译器的 fortran 前端?如果有,那一个生成的代码会更快吗?更新:
使用 -ffast-math -O3
选项生成以下结果:
gfortran
real 0m1.515s
user 0m1.512s
sys 0m0.000s
g++
real 0m1.478s
user 0m1.476s
sys 0m0.000s
clang
real 0m1.253s
user 0m1.252s
sys 0m0.000s
Npw g++
版本的运行速度和 gfortran
一样快,而且 clang
比两者都快。在上述选项中添加-fcx-fortran-rules
不会显着改变结果
最佳答案
时间差异会与执行pow
的时间有关,因为其他代码比较简单。您可以通过分析来检查这一点。那么问题是编译器如何计算幂函数?
我的计时:使用 gfortran -O3
的 Fortran 版本约为 1.20 秒,使用 g++ -O3 -ffast-math
编译的 C++ 版本为 1.07 秒。请注意,-ffast-math
对于 gfortran
无关紧要,因为 pow
将从库中调用,但它对g++
。
在我的例子中,对于 gfortran
,调用的是函数 _gfortran_pow_c8_i4
( source code )。它们的实现是计算整数幂的常用方法。另一方面,对于 g++
,它是 libstdc++ 库中的一个函数模板,但我不知道它是如何实现的。显然,它的编写/优化稍微好一些。考虑到它是一个模板,我不知道该函数在多大程度上是即时编译的。对于它的值(value),使用 ifort
编译的 Fortran 版本和使用 icc
编译的 C++ 版本(使用 -fast
优化标志)都给出相同的计时,所以我猜它们使用相同的库函数。
如果我只是在 Fortran 中用复杂的算术(显式地写出实部和虚部)编写一个幂函数,它的速度与使用 g++
编译的 C++ 版本一样快(但是 -ffast -math
会减慢它的速度,所以我坚持只使用 -O3
和 gfortran
):
complex(8) function pow_c8_i4(a, k)
implicit none
integer, intent(in) :: k
complex(8), intent(in) :: a
real(8) :: Re_a, Im_a, Re_pow, Im_pow, tmp
integer :: i
Re_pow = 1.0_8
Im_pow = 0.0_8
Re_a = real(a)
Im_a = aimag(a)
i = k
do while (i.ne.0)
if (iand(i,1).eq.1) then
tmp = Re_pow
Re_pow = Re_pow*Re_a-Im_pow*Im_a
Im_pow = tmp *Im_a+Im_pow*Re_a
end if
i = ishft(i,-1)
tmp = Re_a
Re_a = Re_a**2-Im_a**2
Im_a = 2*tmp*Im_a
end do
pow_c8_i4 = cmplx(Re_pow,Im_pow,8)
end function
根据我的经验,在 Fortran 实现中使用显式实部和虚部会更快,尽管使用复数类型当然非常方便。
最后说明:尽管这只是一个示例,但每次迭代调用幂函数的方式效率极低。相反,您当然应该在每次迭代时将 a
乘以自身。
关于c++ - clang++/g++/gfortran之间的简单测试用例,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/16639579/
我正在努力实现以下目标, 假设我有字符串: ( z ) ( A ( z ) ( A ( z ) ( A ( z ) ( A ( z ) ( A ) ) ) ) ) 我想编写一个正则
给定: 1 2 3 4 5 6
很难说出这里要问什么。这个问题模棱两可、含糊不清、不完整、过于宽泛或夸夸其谈,无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开,visit the help center . 关闭 1
大家好,我卡颂。 Svelte问世很久了,一直想写一篇好懂的原理分析文章,拖了这么久终于写了。 本文会围绕一张流程图和两个Demo讲解,正确的食用方式是用电脑打开本文,跟着流程图、Demo一
身份证为15位或者18位,15位的全为数字,18位的前17位为数字,最后一位为数字或者大写字母”X“。 与之匹配的正则表达式: ?
我们先来最简单的,网页的登录窗口; 不过开始之前,大家先下载jquery的插件 本人习惯用了vs2008来做网页了,先添加一个空白页 这是最简单的的做法。。。先在body里面插入 <
1、MySQL自带的压力测试工具 Mysqlslap mysqlslap是mysql自带的基准测试工具,该工具查询数据,语法简单,灵活容易使用.该工具可以模拟多个客户端同时并发的向服务器发出
前言 今天大姚给大家分享一款.NET开源(MIT License)、免费、简单、实用的数据库文档(字典)生成工具,该工具支持CHM、Word、Excel、PDF、Html、XML、Markdown等
Go语言语法类似于C语言,因此熟悉C语言及其派生语言( C++、 C#、Objective-C 等)的人都会迅速熟悉这门语言。 C语言的有些语法会让代码可读性降低甚至发生歧义。Go语言在C语言的
我正在使用快速将 mkv 转换为 mp4 ffmpeg 命令 ffmpeg -i test.mkv -vcodec copy -acodec copy new.mp4 但不适用于任何 mkv 文件,当
我想计算我的工作簿中的工作表数量,然后从总数中减去特定的工作表。我错过了什么?这给了我一个对象错误: wsCount = ThisWorkbook.Sheets.Count - ThisWorkboo
我有一个 perl 文件,用于查看文件夹中是否存在 ini。如果是,它会从中读取,如果不是,它会根据我为它制作的模板创建一个。 我在 ini 部分使用 Config::Simple。 我的问题是,如果
尝试让一个 ViewController 通过标准 Cocoa 通知与另一个 ViewController 进行通信。 编写了一个简单的测试用例。在我最初的 VC 中,我将以下内容添加到 viewDi
我正在绘制高程剖面图,显示沿路径的高程增益/损失,类似于下面的: Sample Elevation Profile with hand-placed labels http://img38.image
嗨,所以我需要做的是最终让 regStart 和 regPage 根据点击事件交替可见性,我不太担心编写 JavaScript 函数,但我根本无法让我的 regPage 首先隐藏。这是我的代码。请简单
我有一个非常简单的程序来测量一个函数花费了多少时间。 #include #include #include struct Foo { void addSample(uint64_t s)
我需要为 JavaScript 制作简单的 C# BitConverter。我做了一个简单的BitConverter class BitConverter{ constructor(){} GetBy
已关闭。这个问题是 not reproducible or was caused by typos 。目前不接受答案。 这个问题是由拼写错误或无法再重现的问题引起的。虽然类似的问题可能是 on-top
我是 Simple.Data 的新手。但我很难找到如何进行“分组依据”。 我想要的是非常基本的。 表格看起来像: +________+ | cards | +________+ | id |
我现在正在开发一个 JS UDF,它看起来遵循编码。 通常情况下,由于循环计数为 2,Alert Msg 会出现两次。我想要的是即使循环计数为 3,Alert Msg 也只会出现一次。任何想法都
我是一名优秀的程序员,十分优秀!