- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我一直在寻找很长一段时间,似乎无法找到一个官方/结论性的数字来引用英特尔至强四核可以完成的单精度浮点运算/时钟周期的数量。我有一个 Intel Xeon 四核 E5530 CPU。
我希望用它来计算我的 CPU 可以达到的最大理论 FLOP/s。
MAX FLOPS = (# 核心数) * (时钟频率 (周期/秒)) * (# FLOPS/周期)
任何指向我正确方向的东西都会很有用。我找到了这个
FLOPS per cycle for sandy-bridge and haswell SSE2/AVX/AVX2
Intel Core 2 and Nehalem:
4 DP FLOPs/cycle: 2-wide SSE2 addition + 2-wide SSE2 multiplication
8 SP FLOPs/cycle: 4-wide SSE addition + 4-wide SSE multiplication
最佳答案
Nehalem 能够执行 4 DP 或 8 SP FLOP/cycle。这是使用 SSE 完成的,它对压缩浮点值、DP 中的 2/寄存器和 SP 中的 4/寄存器进行操作。为了实现 4 DP FLOP/cycle 或 8 SP FLOP/cycle,内核必须在每个周期执行 2 个 SSE 指令。这是通过在每个周期执行一个 MULDP 和一个 ADDDP(或一个 MULSP 和一个 ADDSP)来完成的。这是可能的原因是因为 Nehalem 有单独的执行单元用于 SSE 乘法和 SSE 加法,并且这些单元是流水线的,因此 throughput
是每个周期一次乘法和一次加法。乘法器流水线中的乘法器在 SP 中为 4 个周期,在 DP 中为 5 个周期。添加在流水线中持续 3 个周期,与 SP/DP 无关。管道中的周期数称为 latency
.要计算峰值 FLOP/cycle,您只需要知道吞吐量。因此,乘法器和加法器(2 个执行单元)的吞吐量均为 1 个 SSE 向量指令/周期,DP 中有 2 x 2 = 4 FLOP/周期,SP 中有 2 x 4 = 8 FLOP/周期。为了实际维持这个峰值吞吐量,您需要考虑延迟(因此您在管道中至少有与管道深度一样多的独立操作)并且您需要考虑能够足够快地提供数据。 Nehalem 有一个集成的内存 Controller ,能够从内存中获得非常高的带宽,如果数据预取器正确地预测数据的访问模式(从内存中顺序加载是它可以预测的一个微不足道的模式),它就可以实现这一目标。通常没有足够的内存带宽来维持以峰值 FLOP/周期向所有内核提供数据,因此需要对缓存中的数据进行一定量的重用以维持峰值 FLOP/周期。
以下是有关在何处可以找到有关独立执行单元数量及其吞吐量和周期延迟的信息的详细信息。
见第 105 页 8.9 执行单元本文件的
http://www.agner.org/optimize/microarchitecture.pdf
它说对于尼哈勒姆
The floating point multiplier on port 0 has a latency of 4 for single precision and 5 for double and long double precision. The throughput of the floating point multiplier is 1 operation per clock cycle, except for long double precision on Core2. The floating point adder is connected to port 1. It has a latency of 3 and is fully pipelined.
关于cpu - 每个周期的浮点运算 - 英特尔,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/23203710/
为什么 (defun boolimplies (a b) (or (not a) b)) if called as(boolimplies 'a 'b) 返回 B? 即使我不使用任何 boolean
这个问题已经有答案了: Are there builtin functions for elementwise boolean operators over boolean lists? (5 个回答
我正在寻求帮助以使以下功能看起来更清晰。我觉得我可以通过使用更少的代码行来实现同样的目标。 标题看起来一定很困惑,所以让我详细说明一下。我创建了一个函数,它接受用户输入(即 72+5),将字符串拆分为
我正在学习 C++ 并尝试为矩阵编写一个 C++ 类,我在其中将矩阵存储为一维 C 数组。为此,我定义了一个 element成员函数根据矩阵元素在数组中的位置访问矩阵元素。然后我重载了 class
我正在学习 C++ 并尝试为矩阵编写一个 C++ 类,我在其中将矩阵存储为一维 C 数组。为此,我定义了一个 element成员函数根据矩阵元素在数组中的位置访问矩阵元素。然后我重载了 class
伙计们,以下内容不起作用 函数返回 true,变量返回 false,但它不会进入 when 子句。我尝试像这样放大括号 但是当我将变量的值设置为 true 并将上面的代码更改为 它进入w
关闭。此题需要details or clarity 。目前不接受答案。 想要改进这个问题吗?通过 editing this post 添加详细信息并澄清问题. 已关闭 9 年前。 Improve th
我是原生 C 语言的新手,但我没有看到错误。 我尝试在这种情况下使用 if 操作: #define PAGE_A 0 #define PAGE_B 1 int pageID = 0; if (page
我正在从事一个项目,让用户鼠标滚轮移动并知道它向上或向下滚动。在我的代码中,我可以上下移动。但我想将 Action 保存到一个字符串中。例如,如果用户向上向上向下滚动'mhmh' 显示返回“UUD”但
我有一个 MySQL 表 payment我在其中存储客户的所有付款相关数据。表字段为:fileNo , clientName , billNo , billAmount , status 。我想构建一
我的表架构如下: +------+-------+-------+
我有这个(顺便说一句,我刚刚开始学习): #include #include using namespace std; int main() { string mystr; cout << "We
我正在用 bash 构建一个用于 Linux (SLES 11SP3) 的脚本。我想通过使用以下语法查找它的 pid 来检查某个进程是否存在: pid="$(ps -ef | grep -v grep
我有一个包含两列的表格; CREATE TABLE IF NOT EXISTS `QUESTION_CATEGORY_RELATION` ( `question_id` int(16) NOT N
我对 Python 如何计算 bool 语句感到困惑。 例如 False and 2 or 3 返回 3 这是如何评估的?我认为 Python 首先会查看“False and 2”,甚至不查看“or
这个问题在这里已经有了答案: 12 年前关闭。 这可能是非常基本的......但我似乎不明白: 如何 (2 & 1) = 0 (3 & 1) = 1 (4 & 1) = 0 等等.. 上面的这种模式似
无论如何在Haskell中定义如下函数? or True True = True or True undefined = True or True False
如您所知,TCL 有一些数学函数,例如 罪 , 因 , 和 假设 在 中调用的expr 带有 的命令() 大括号如下: puts [expr sin(1.57)] 现在如何使用 TCL 添加功能 li
让我们考虑两个数组列表。 ArrayList list1 = new ArrayList(); list1.add(1); list1.add(2); list1.add(3); ArrayList
我想包含和排除使用AND和OR的专业知识,包括与AND和OR操作正常工作。但是,当将排除专家与AND和OR一起使用时,返回与3相同的结果计数。我使用的是1.4版 Elasticsearch 。帮助我解
我是一名优秀的程序员,十分优秀!