- Java 双重比较
- java - 比较器与 Apache BeanComparator
- Objective-C 完成 block 导致额外的方法调用?
- database - RESTful URI 是否应该公开数据库主键?
我一直认为 foo2
下面的函数比 foo3
快,直到经过测试。
所有代码如下:
#include <iostream>
#include <boost/timer.hpp>
#include <boost/lexical_cast.hpp>
#include <stdint.h>
struct session {
bool operator==(const session& r) const;
uint8_t proto;
uint16_t sport;
uint16_t dport;
uint32_t sip;
uint32_t dip;
};
bool session::operator==(const session& r) const {
return proto == r.proto && sport == r.sport && dport == r.dport
&& sip == r.sip && dip == r.dip;
}
// my L1,L2,L3 total cache size is 16MB, so set it 32MB to overflow all 16MB caches.
static const int SIZE = 32 * 1024 * 1024 / sizeof(session);
int sum;
void foo1(session* p) {
session s = {1, 2, 3, 4, 5};
for (int i = 0; i < SIZE; i++)
if (p[i] == s)
sum++;
}
void foo2(session* p) {
session s = {1, 2, 3, 4, 5};
int n = SIZE - SIZE % 4;
int i;
for (i = 0; i < n; i += 4) {
if (p[i + 0] == s)
sum++;
if (p[i + 1] == s)
sum++;
if (p[i + 2] == s)
sum++;
if (p[i + 3] == s)
sum++;
}
/*
for (; i < SIZE; i++)
if (p[i] == s)
sum++;
*/
}
void foo3(session* p) {
session s = {1, 2, 3, 4, 5};
int n = SIZE - SIZE % 4;
int i;
for (i = 0; i < n; i += 4) {
if (p[i + 0] == s)
sum++;
else if (p[i + 1] == s)
sum++;
else if (p[i + 2] == s)
sum++;
else if (p[i + 3] == s)
sum++;
}
/*
for (; i < SIZE; i++)
if (p[i] == s)
sum++;
*/
}
int main(int argc, char* argv[]) {
if (argc < 2)
return -1;
int n = boost::lexical_cast<int>(argv[1]);
session* p = new session[SIZE];
boost::timer t;
for (int i = 0; i < n; i++)
foo1(p);
std::cout << t.elapsed() << std::endl;
t.restart();
for (int i = 0; i < n; i++)
foo2(p);
std::cout << t.elapsed() << std::endl;
t.restart();
for (int i = 0; i < n; i++)
foo3(p);
std::cout << t.elapsed() << std::endl;
delete [] p;
return 0;
}
测试1000次,./a.out 1000
输出:
4.36
3.98
3.96
我的机器:
CPU:Intel(R) Xeon(R) CPU E5-2420 0 @ 1.90GHz
缓存:
一级缓存:32K
一级缓存:32K
二级缓存:256K
三级缓存:15360K
在测试中,foo2
和foo3
性能相当。由于 foo2
可能大小写CPU 并行执行所有展开的表达式,所以 foo3
是相同的。是吗?如果是,则 else if
语法违反了 C/C++ 基本 else if
语义。
有人解释一下吗?非常感谢。
更新
我的编译器是 gcc 4.4.6 ins RedHat
g++ -Wall -O2 a.cpp
最佳答案
在某些情况下,我希望 foo3 更快,因为它可以短路(会出现一些小于或等于 4 的分支,而在 foo2 中,总是出现 4 个分支)。在 s
不等于 4 个数组元素中的任何一个的情况下(在这种情况下极有可能),foo2 和 foo3 基本上是相同的代码。在这种情况下,两个函数都会发生 4 个分支。
考虑一下 foo3 的真实情况(就分支而言):
if (p[i + 0] == s)
sum++;
else
if (p[i + 1] == s)
sum++;
else
if (p[i + 2] == s)
sum++;
else
if (p[i + 3] == s)
sum++;
这应该表明,只要 if
一直为假,子分支就会发生。这意味着在所有 if 都不为真的情况下,它将执行与 foo2 相同数量的操作(尽管功能不同)。
一种粗略的思考方式是好像每个 if
都有一个成本(不是 if 的主体,实际的 if)。也就是说,执行流程中每走到一个if
,都需要付出一定的代价。这是因为必须完成一个分支。这样想,很明显,当 foo3 的流程没有短路时(当 foo3
的所有 4 个 if
都短路时,每个函数的成本是相同的遭遇)。 (正如 KillianDS 指出的那样,如果分支预测是错误的,那么 foo3 实际上会花费更长的时间,因为错误的分支将不得不倒回并执行正确的分支。尽管总是选择正确的分支,但对您来说似乎是这样。)
这有点像下面的代码片段如何具有相同的性能:
if (short_runtime()) {}
和:
if (short_runtime() && long_runtime()) {}
如果 short_runtime
返回 true,那么调用第二个函数的函数显然会花费更长的时间。如果 short_runtime()
返回为 false,则 long_runtime()
调用将永远不会发生,因此运行时间将相同(或者至少非常 类似)。
为了检验这个理论,您可以使 p[i + 0] == s
为真。只需值初始化数组 (session* p = new session[SIZE]();
),并使用 session s = {1, 2, 3, 4, 5};
本地。
循环展开的目的/结果似乎有点困惑。这样做是为了减少必须发生的跳跃。如果必须完成 n
次操作,而不是 n
次迭代(跳跃),每次迭代执行 1 个操作,您可以进行 n/k
次迭代(跳跃)反而发生了。当一切都适合缓存时,这可以提供速度提升(如果它不能适合缓存,它实际上会降低性能!)。
这些指令不是同时发生的(如果是,sum
将需要一个围绕它的互斥量,这将非常昂贵)。它们只是以 4 组而不是 1 组的形式出现。
关于c++ - 在 "loop unrolling"中,所有展开的表达式都执行了吗?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/18249987/
我有一个“有趣”的问题,即以两种不同的方式运行 wine 会导致: $> wine --version /Applications/Wine.app/Contents/Resources/bin/wi
我制作了这个网络抓取工具来获取网页中的表格。我使用 puppeteer (不知道 crontab 有问题)、Python 进行清理并处理数据库的输出 但令我惊讶的是,当我执行它时 */50 * * *
JavaScript 是否被调用或执行取决于什么?准确地说,我有两个函数,它们都以相同的方式调用: [self.mapView stringByEvaluatingJavaScriptFromStri
我目前正在使用 python 做一个机器学习项目(这里是初学者,从头开始学习一切)。 只是想知道 statsmodels 的 OLS 和 scikit 的 PooledOlS 使用我拥有的相同面板数据
在使用集成对象模型 (IOM) 后,我可以执行 SAS 代码并将 SAS 数据集读入 .Net/C# 数据集 here . 只是好奇,使用 .Net 作为 SAS 服务器的客户端与使用 Enterpr
有一些直接的 jQuery 在单击时隐藏打开的 div 未显示,但仍将高度添加到导航中以使其看起来好像要掉下来了。 这个脚本工作正常: $(document).ready(funct
这个问题已经有答案了: How do I compare strings in Java? (23 个回答) 已关闭 4 年前。 这里是 Java 新手,我正在使用 NetBeans 尝试一些简单的代
如果我将它切换到 Python 2.x,它执行 10。这是为什么? 训练逻辑回归模型 import keras.backend as
我有两个脚本,它们包含在 HTML 正文中。在第一个脚本中,我初始化一个 JS 对象,该对象在第二个脚本标记中引用。 ... obj.a = 1000; obj.
每当我运行该方法时,我都会收到一个带有数字的错误 以下是我的代码。 public String getAccount() { String s = "Listing the accounts";
我已经用 do~while(true) 创建了我的菜单;但是每次用户输入一个数字时,它不会运行程序,而是再次显示菜单!你怎么看? //我的主要方法 public static void main(St
执行命令后,如何让IPython通知我?我可以使用铃声/警报还是通过弹出窗口获取它?我正在OS X 10.8.5的iTerm上运行Anaconda。 最佳答案 使用最新版本的iTerm,您可以在she
您好,我刚刚使用菜单栏为 Swing 编写了代码。但是问题出现在运行中。我输入: javac Menu.java java Menu 它没有给出任何错误,但 GUI 没有显示。这是我的源代码以供引用:
我觉得这里缺少明显的东西,但是我看不到它写在任何地方。 我使用Authenticode证书对可执行文件进行签名,但是当我开始学习有关它的更多信息时,我对原样的值(value)提出了质疑。 签名的exe
我正在设计一个应用程序,它使用 DataTables 中的预定义库来创建数据表。我想对数据表执行删除操作,为此应在按钮单击事件上执行 java 脚本。 $(document).ready(functi
我是 Haskell 新手,如果有人愿意帮助我,我会很高兴!我试图让这个程序与 do while 循环一起工作。 第二个 getLine 命令的结果被放入变量 goGlenn 中,如果 goGlenn
我有一个用 swing 实现迷你游戏的程序,在主类中我有一个循环,用于监听游戏 map 中的 boolean 值。使用 while 实现的循环不会执行一条指令,如果它是唯一的一条指令,我不知道为什么。
我正在尝试开发一个连接到 Oracle 数据库并执行函数的 Java 应用程序。如果我在 Eclipse 中运行该应用程序,它可以工作,但是当我尝试在 Windows 命令提示符中运行 .jar 时,
我正在阅读有关 Java 中的 Future 和 javascript 中的 Promises 的内容。下面是我作为示例编写的代码。我的问题是分配给 future 的任务什么时候开始执行? 当如下行创
我有一个常见的情况,您有两个变量(xSpeed 和 ySpeed),当它们低于 minSpeed 时,我想将它们独立设置为零,并在它们都为零时退出。 最有效的方法是什么?目前我有两种方法(方法2更干净
我是一名优秀的程序员,十分优秀!