- Java 双重比较
- java - 比较器与 Apache BeanComparator
- Objective-C 完成 block 导致额外的方法调用?
- database - RESTful URI 是否应该公开数据库主键?
有时关联性可用于松散数据依赖性,我很好奇它能提供多大帮助。我很惊讶地发现,通过手动展开一个简单的循环,我几乎可以将速度提高 4 倍,无论是在 Java (build 1.7.0_51-b13) 还是在 C (gcc 4.4) 中.3).
所以要么我在做一些非常愚蠢的事情,要么编译器忽略了一个强大的工具。我开始于
int a = 0;
for (int i=0; i<N; ++i) a = M1 * a + t[i];
它计算的东西接近于 String.hashCode()
(设置 M1=31
并使用 char[]
)。计算非常简单,对于 t.length=1000
,我的 i5-2400 @ 3.10GHz(在 Java 和 C 中)大约需要 1.2 微秒。
观察每两个步骤 a
乘以 M2 = M1*M1
并添加一些东西。这就引出了这段代码
int a = 0;
for (int i=0; i<N; i+=2) {
a = M2 * a + (M1 * t[i] + t[i+1]); // <-- note the parentheses!
}
if (i < len) a = M1 * a + t[i]; // Handle odd length.
这比第一个片段快两倍。奇怪的是,省略括号会减少 20% 的加速。有趣的是,这可以重复进行,并且可以达到 3.8 的系数。
与 java 不同,gcc -O3
选择不展开循环。这是明智的选择,因为无论如何它都无济于事(如 -funroll-all-loops
所示)。
所以我的问题1是:是什么阻碍了这种优化?
谷歌搜索无效,我只得到“关联数组”和“关联运算符”。
我擦亮了我的 benchmark一点点,可以提供一些results现在。除了展开 4 次之外没有任何加速,可能是因为乘法和加法一起需要 4 个周期。
由于 Java 已经展开了循环,所以所有艰苦的工作都已完成。我们得到的是这样的
...pre-loop
for (int i=0; i<N; i+=2) {
a2 = M1 * a + t[i];
a = M1 * a2 + t[i+1];
}
...post-loop
有趣的部分可以像这样重写
a = M1 * ((M1 * a) + t[i]) + t[i+1]; // latency 2mul + 2add
这表明有 2 个乘法和 2 个加法,所有这些都按顺序执行,因此在现代 x86 CPU 上需要 8 个周期。我们现在需要的只是一些小学数学(即使在溢出或其他情况下也适用于 int
,但不适用于 float )。
a = ((M1 * (M1 * a)) + (M1 * t[i])) + t[i+1]; // latency 2mul + 2add
到目前为止我们一无所获,但它允许我们折叠常量
a = ((M2 * a) + (M1 * t[i])) + t[i+1]; // latency 1mul + 2add
通过重新组合和获得更多
a = (M2 * a) + ((M1 * t[i]) + t[i+1]); // latency 1mul + 1add
最佳答案
以下是我对您的两种情况的理解:在第一种情况下,您有一个需要 N 步的循环;在第二种情况下,您手动将第一种情况的两个连续迭代合并为一个,因此在第二种情况下您只需要执行 N/2 个步骤。你的第二个案例运行得更快,你想知道为什么愚蠢的编译器不能自动完成它。
没有什么可以阻止编译器进行此类优化。但请注意,这种对原始循环的重写会导致更大的可执行文件大小:您for
内有更多说明循环和额外的 if
循环之后。
如果 N=1 或 N=3,原始循环可能会更快(更少的分支和更好的缓存/预取/分支预测)。它使事情变得更快在你的情况下但它可能使事情在其他情况下变慢。是否值得进行此优化尚不清楚,在编译器中实现此类优化可能非常重要。
顺便说一句,您所做的与循环矢量化非常相似,但在您的情况下,您手动执行了并行步骤并插入了结果。埃里克布鲁默的 Compiler Confidential谈话会让您了解为什么重写循环通常很棘手,以及有哪些缺点/缺点(更大的可执行文件大小,在某些情况下可能更慢)。因此,编译器编写者非常清楚这种优化的可能性,并正在积极致力于此,但它通常非常重要,并且还会使事情变得更慢。
请为我尝试一些东西:
int a = 0;
for (int i=0; i<N; ++i)
a = ((a<<5) - a) + t[i];
假设M1=31
.原则上,编译器应该足够聪明来重写 31*a
进入(a<<5)-a
但我很好奇它是否真的这样做了。
关于java - 编译器使用关联性有什么问题?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/21745619/
关闭。这个问题是off-topic .它目前不接受答案。 想要改进这个问题? Update the question所以它是on-topic用于堆栈溢出。 关闭 12 年前。 Improve thi
我有一个动态网格,其中的数据功能需要正常工作,这样我才能逐步复制网格中的数据。假设在第 5 行中,我输入 10,则从第 6 行开始的后续行应从 11 开始读取,依此类推。 如果我转到空白的第一行并输入
我有一个关于我的按钮消失的问题 我已经把一个图像作为我的按钮 用这个函数动画 function example_animate(px) { $('#cont
我有一个具有 Facebook 连接和经典用户名/密码登录的网站。目前,如果用户单击 facebook_connect 按钮,系统即可运行。但是,我想将现有帐户链接到 facebook,因为用户可以选
我有一个正在为 iOS 开发的应用程序,该应用程序执行以下操作 加载和设置注释并启动核心定位和缩放到位置。 map 上有很多注释,从数据加载不会花很长时间,但将它们实际渲染到 map 上需要一段时间。
我被推荐使用 Heroku for Ruby on Rails 托管,到目前为止,我认为我真的会喜欢它。只是想知道是否有人可以帮助我找出问题所在。 我按照那里的说明在该网站上创建应用程序,创建并提交
我看过很多关于 SSL 错误的帖子和信息,我自己也偶然发现了一个。 我正在尝试使用 GlobalSign CA BE 证书通过 Android WebView 访问网页,但出现了不可信错误。 对于大多
我想开始使用 OpenGL 3+ 和 4,但我在使用 Glew 时遇到了问题。我试图将 glew32.lib 包含在附加依赖项中,并且我已将库和 .dll 移动到主文件夹中,因此不应该有任何路径问题。
我已经盯着这两个下载页面的源代码看了一段时间,但我似乎找不到问题。 我有两个下载页面,一个 javascript 可以工作,一个没有。 工作:http://justupload.it/v/lfd7不是
我一直在使用 jQuery,只是尝试在单击链接时替换文本字段以及隐藏/显示内容项。它似乎在 IE 中工作得很好,但我似乎无法让它在 FF 中工作。 我的 jQuery: $(function() {
我正在尝试为 NDK 编译套接字库,但出现以下两个错误: error: 'close' was not declared in this scope 和 error: 'min' is not a m
我正在使用 Selenium 浏览器自动化框架测试网站。在测试过程中,我切换到特定的框架,我们将其称为“frame_1”。后来,我在 Select 类中使用了 deselectAll() 方法。不久之
我正在尝试通过 Python 创建到 Heroku PostgreSQL 数据库的连接。我将 Windows10 与 Python 3.6.8 和 PostgreSQL 9.6 一起使用。 我从“ht
我有一个包含 2 列的数据框,我想根据两列之间的比较创建第三列。 所以逻辑是:第 1 列 val = 3,第 2 列 val = 4,因此新列值什么都没有 第 1 列 val = 3,第 2 列 va
我想知道如何调试 iphone 5 中的 css 问题。 我尝试使用 firelite 插件。但是从纵向旋转到横向时,火石占据了整个屏幕。 有没有其他方法可以调试 iphone 5 中的 css 问题
所以我有点难以理解为什么这不起作用。我正在尝试替换我正在处理的示例站点上的类别复选框。我试图让它做以下事情:未选中时以一种方式出现,悬停时以另一种方式出现(选中或未选中)选中时以第三种方式出现(而不是
Javascript CSS 问题: 我正在使用一个文本框来写入一个 div。我使用以下 javascript 获取文本框来执行此操作: function process_input(){
你好,我很难理解 P、NP 和多项式时间缩减的主题。我试过在网上搜索它并问过我的一些 friend ,但我没有得到任何好的答案。 我想问一个关于这个话题的一般性问题: 设 A,B 为 P 中的语言(或
你好,我一直在研究 https://leetcode.com/problems/2-keys-keyboard/并想到了这个动态规划问题。 您从空白页上的“A”开始,完成后得到一个数字 n,页面上应该
我正在使用 Cocoapods 和 KIF 在 Xcode 服务器上运行持续集成。我已经成功地为一个项目设置了它来报告每次提交。我现在正在使用第二个项目并收到错误: Bot Issue: warnin
我是一名优秀的程序员,十分优秀!