- iOS/Objective-C 元类和类别
- objective-c - -1001 错误,当 NSURLSession 通过 httpproxy 和/etc/hosts
- java - 使用网络类获取 url 地址
- ios - 推送通知中不播放声音
我在 C++ 程序中进行了大量矩阵乘法运算,我使用与英特尔的 MKL (2018.3.222) 链接的 Eigen (3.3.5)。我使用 MKL 的顺序版本并且 OpenMP 被禁用。问题是它比 Matlab 慢。
一些示例代码:
#define NDEBUG
#define EIGEN_USE_MKL_ALL
#include <iostream>
#include <chrono>
#include <Core>
using namespace Eigen;
using namespace std;
int main(){
MatrixXd jac = 100*MatrixXd::Random(10*1228, 2850);
MatrixXd res = MatrixXd::Zero(2850, 2850);
for (int i=0; i<10; i++){
auto begin = chrono::high_resolution_clock::now();
res.noalias() = jac.transpose()*jac;
auto end = chrono::high_resolution_clock::now();
cout<<"time: "<<chrono::duration_cast<chrono::milliseconds>(end-begin).count() <<endl;
}
return 0;
}
它平均报告大约 8 秒。在带有 g++ 6.4 的 Ubuntu 16.04 上使用 -O3 编译且没有调试符号。
Matlab代码:
m=100*(-1+2*rand(10*1228, 2850));
res = zeros(2850, 2850);
tic; res=m'*m; toc
它报告大约 4 秒,快两倍。我在具有 maxNumCompThreads(1) 的同一系统上使用 Matlab R2017a。 Matlab 使用 MKL 11.3。
在没有 MKL 且仅使用 Eigen 的情况下,大约需要 18 秒。我该怎么做才能将 C++ 运行时间降低到与 Matlab 相同的值?谢谢。
稍后编辑:正如@Qubit 所建议的那样,Matlab 认识到我正在尝试将矩阵与其转置相乘并进行一些“隐藏”优化。当我在 Matlab 中将两个不同的矩阵相乘时,时间达到了 8 秒。那么,现在的问题就变成了:我如何告诉 Eigen 这个矩阵乘积是“特殊的”并且可以进一步优化?
后期编辑 2:我试过这样做:
MatrixXd jac = 100*MatrixXd::Random(10*1228, 2850);
MatrixXd res = MatrixXd::Zero(2850, 2850);
auto begin = chrono::high_resolution_clock::now();
res.selfadjointView<Lower>().rankUpdate(jac.transpose(), 1);
res.triangularView<Upper>() = res.transpose();
auto end = chrono::high_resolution_clock::now();
MatrixXd oldSchool = jac.transpose()*jac;
if (oldSchool.isApprox(res)){
cout<<"same result!"<<endl;
}
cout<<"time: "<<chrono::duration_cast<chrono::milliseconds>(end-begin).count() <<endl;
但现在需要 9.4 秒(这是没有 MKL 的 Eigen 经典产品所需时间的一半)。禁用 MKL 对此计时没有时间影响,因此我相信“rankUpdate”方法不使用 MKL ?!?
最后编辑:我在 eigen 头文件中发现了一个错误:
Core/products/GeneralMatrixMatrixTriangular_BLAS.h
在第 55 行。有一个错位的括号。我改变了这个:
if ( lhs==rhs && ((UpLo&(Lower|Upper)==UpLo)) ) { \
为此:
if ( lhs==rhs && ((UpLo&(Lower|Upper))==UpLo) ) { \
现在,我的 C++ 版本和 Matlab 具有相同的执行速度(在我的系统上约为 4 秒)。
最佳答案
真正的答案,因为你已经弄清楚了问题,但有一些评论:
问题 Core/products/GeneralMatrixMatrixTriangular_BLAS.h
已经在 devel 分支中修复,但事实证明它从未被移植到 3.3 分支。
现在的问题是fixed在 3.3 分支中。该修复将成为 3.3.6 的一部分。
单线程模式下内置 Eigen 和 MKL 之间的加速因子 x2 没有意义。除了 -O3 -DNDEBUG
之外,请确保通过使用 -march=native
进行编译来启用您的 CPU 支持的所有功能。在我的 Haswell 2.6GHz 上,我得到了 3.4s 和 3s。
关于c++ - 对于矩阵乘法,Eigen + MKL 比 Matlab 慢,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/51874027/
在 Matlab 中,您可以选择创建新的“示例”脚本文件以及脚本、函数、类等。创建它们时,它们会获得一个脚本图标。 它们与其他标准脚本文件的处理方式有何不同? 是否有关于这些示例脚本类型的预期用途的文
我正在运行一个不是我自己编写的大 m 文件,它依赖于某些子函数。我想知道是否在所有嵌套函数的任何地方都使用了特定函数(在我的例子中是函数 eig.m(计算特征值))。有没有快速的方法来做到这一点? 亲
Matlab中有一个函数叫 copulafit .我怎样才能看到这个函数背后的代码?许多 Python 的 numpy 和 scipy 函数在 Github 上很容易开源,但由于某种原因我在 Gith
我定义了一个抽象基类measurementHandler < handle它定义了所有继承类的接口(interface)。这个类的两个子类是a < measurementHandler和 b < me
假设有一个矩阵 A = 1 3 2 4 4 2 5 8 6 1 4 9 例如,我有一个 Vector 包含该矩阵每一列的“类”
我有一个在后台运行的 Matlab 脚本。随着计算的进行,它会不断弹出进度栏窗口。这很烦人。 问题是我没有自己写 Matlab 脚本,这是一段很长很复杂的代码,我不想搞砸。那么如何在不修改 Matla
有没有办法从一个 matlab 程序中检测计算机上正在运行多少个 matlab 进程? 我想要恰好有 n 个 matlab 进程在运行。如果我的数量太少,我想创建它们,如果数量太多,我想杀死一些。您当
我正在测试我们在 Matlab 中开发的一个独立应用程序,当时我注意到它的内存使用量(根据 Windows 任务管理器)达到了 16gb 以上的数倍峰值。我决定在编译版本后面的脚本上使用 profil
我面临着一个相当棘手的问题。在 Matlab 中,命令 S = char(1044) 将俄语字母 д 放入变量 S。但是 disp(S) 返回空白符号,尽管内容实际上是正确的: >> S = char
我在这行 MATLAB 代码中遇到内存不足错误: result = (A(1:xmax,1:ymax,1:zmax) .* B(2:xmax+1,2:ymax+1,2:zmax+1) +
我正在寻找一种在 MATLAB 中比较有限顺序数据与非确定性顺序的方法。基本上,我想要的是一个数组,但不对包含的元素强加顺序。如果我有对象 a = [x y z]; 和 b = [x z y]; 我希
我有一个由 1 和 0 组成的二维矩阵。 mat = [0 0 0 0 1 1 1 0 0 1 1 1 1 1 0 0 1 0 0 0 1 0 1 1 0 0 1]; 我需
我可以在 Matlab 中用一组 x,y 点绘制回归线。但是,如果我有一组点(如下图),假设我有四组点,我想为它们绘制四条回归线……我该怎么做?所有的点都保存在 x,y 中。没有办法将它们分开并将它们
我正在尝试使用以下代码在 MATLAB 中绘制圆锥体。但是,当 MATLAB 生成绘图时,曲面中有一个间隙,如下图所示。谁能建议关闭它的方法? clearvars; close all; clc; [
我有一个 map称为 res_Map,包含一组不同大小的数组。我想找到用于存储 res_Map 的总内存。 正如您在下面看到的,看起来 res_Map 几乎不占用内存,而 res_Map 中的各个元素
有没有办法在 MATLAB 中组合 2 个向量,这样: mat = zeros(length(C),length(S)); for j=1:length(C) mat(j,:)=C(j)*S;
已结束。此问题不符合 Stack Overflow guidelines 。它目前不接受答案。 我们不允许提问寻求书籍、工具、软件库等的推荐。您可以编辑问题,以便用事实和引用来回答它。 关闭 5 年前
我正在尝试将MatLab中的t copula适配到我的数据,并且我的功能是: u = ksdensity(range_1, range_1,'function','cdf'); v = ksdens
大家好,我目前正在尝试使用论文“多尺度形态学图像简化”中的 SMMT 运算符 Dorini .由于没有订阅无法访问该页面,因此我将相关详细信息发布在这里: 请注意,我将相关文章的部分内容作为图片发布。
我在MATLAB中编写代码,需要使用一个名为modwt的函数,该函数同时存在于两个我同时使用的工具箱(Wavelet和WMTSA)中。问题在于,一个版本仅返回一个输出,而另一个版本则返回三个输出。我应
我是一名优秀的程序员,十分优秀!