opencv - 将 OpenCV 的 Mat 容器与用于矩阵乘法的 blas 接口(interface)-6ren

opencv - 将 OpenCV 的 Mat 容器与用于矩阵乘法的 blas 接口(interface)

转载作者：太空宇宙更新时间：2023-11-03 22:51:04

24

4

我正在处理超高清 (2160 x 3840) 图像。我所做的其中一项处理包括在 X 轴和 Y 轴上处理 Sobel 滤波，然后我必须将每个输出矩阵乘以它的转置，然后我将梯度图像处理为梯度总和的平方根。

所以:S = sqrt( S_x * S_x^t + S_y * S_y^t)。

由于图像的尺寸，OpenCV 在不使用多线程的情况下最多需要 20 秒来处理该图像，而使用多线程则需要 10 秒。

我知道 OpenCV 会调用 OpenCL 以加快过滤操作，因此我认为可能需要很长时间才能尝试从过滤步骤中获得性能。

对于矩阵乘法，我从 OpenCV 的 OpenCL gemm 内核实现中体验到一种不稳定性。

所以我想尝试使用 OpenBLAS insted。

我的问题是:

1.)

我编写了以下代码，但我遇到了 OpenCV 的 Mat 对象接口(interface)的一些问题:

template<class _Ty>
void mm(cv::Mat& A,cv::Mat& B,cv::Mat& C)
{
    static_assert(true,"support matrix_multiply is only defined for floating precision numbers.");
}

template<>
inline void mm<float>(cv::Mat& A,cv::Mat& B,cv::Mat& C)
{
    const int M = A.rows;
    const int N = B.cols;
    const int K = A.cols;

    cblas_sgemm( CblasRowMajor ,// 1
                 CblasNoTrans, // 2 TRANSA
                 CblasNoTrans, // 3 TRANSB
                 M,       // 4 M
                 N,       // 5 N
                 K,       // 6 K
                 1.,           // 7 ALPHA
                 A.ptr<float>(),//8 A
                 A.rows,        //9 LDA
                 B.ptr<float>(),//10 B
                 B.rows,        //11 LDB
                 0.,            //12 BETA
                 C.ptr<float>(),//13 C
                 C.rows);       //14 LDC

}

template<>
inline void mm<double>(cv::Mat& A,cv::Mat& B,cv::Mat& C)
{
    cblas_dgemm(CblasRowMajor,CblasNoTrans,CblasNoTrans,A.rows,B.cols,A.cols,1.,A.ptr<double>(),A.rows,B.ptr<double>(),B.cols,0.,C.ptr<double>(),C.rows);
}
    void matrix_multiply(cv::InputArray _src1, cv::InputArray _src2, cv::OutputArray _dst)
    {

        CV_DbgAssert(  (_src1.isMat() || _src1.isUMat()) && (_src1.kind() == _src2.kind()) &&
                      (_src1.depth() == _src2.depth()) && (_src1.depth() == CV_32F) && (_src1.depth() == _src1.type()) &&
                      (_src1.rows() == _src2.cols())
                       );


        cv::Mat src1 = _src1.getMat();
        cv::Mat src2 = _src2.getMat();
        cv::Mat dst;

        bool cpy(false);

        if(_dst.rows() == _src1.rows() && _dst.cols() == _src2.cols() && _dst.type() == _src1.type())
            dst = _dst.getMat();
        else
        {
            dst = cv::Mat::zeros(src1.rows,src2.cols,src1.type());
            cpy = true;
        }

        if(cpy)
            dst.copyTo(_dst);
    }

我尝试按照此处指定的方式组织数据: http://www.netlib.org/lapack/explore-html/db/dc9/group__single__blas__level3.html#gafe51bacb54592ff5de056acabd83c260

没有成功。这是我的主要问题

2.) 我在想，为了尝试加快我的实现速度，以应用此处说明的分而治之方法:

https://en.wikipedia.org/wiki/Matrix_multiplication_algorithm

但是对于只有四个子矩阵。有没有人尝试过类似的方法或获得更好的方法来获得矩阵乘法的性能(不使用 GPU)？

提前感谢您的帮助。

最佳答案

我找到了问题 1) 的解决方案。我的第一个实现基于 BLAS 库的文档。BLAS 是用 Fortran 语言编写的，在这种语言中，索引从 1 开始，而不是像 C 或 C++ 中那样从 0 开始。另一件事是许多用 Fortran 语言编写的库按列顺序组织内存(例如 BLAS、LAPACK)，而不是大多数 C 或 C++ 库(例如 OpenCV)按行顺序组织内存。

在计算这两个属性后，我将代码修改为:

template<class _Ty>
void mm(cv::Mat& A,cv::Mat& B,cv::Mat& C)
{
    static_assert(true,"The function gemm is only defined for floating precision numbers.");
}

template<>
void mm<float>(cv::Mat& A,cv::Mat& B,cv::Mat& C)
{
    const int M = A.cols+1;
    const int N = B.rows;
    const int K = A.cols;

    cblas_sgemm( CblasRowMajor ,// 1
                 CblasNoTrans, // 2 TRANSA
                 CblasNoTrans, // 3 TRANSB
                 M,       // 4 M
                 N,       // 5 N
                 K,       // 6 K
                 1.,           // 7 ALPHA
                 A.ptr<float>(),//8 A
                 A.step1(),        //9 LDA
                 B.ptr<float>(),//10 B
                 B.step1(),        //11 LDB
                 0.,            //12 BETA
                 C.ptr<float>(),//13 C
                 C.step1());       //14 LDC
}

template<>
void mm<double>(cv::Mat& A,cv::Mat& B,cv::Mat& C)
{
    const int M = A.cols+1;
    const int N = B.rows;
    const int K = A.cols;

    cblas_dgemm( CblasRowMajor ,// 1
                 CblasNoTrans, // 2 TRANSA
                 CblasNoTrans, // 3 TRANSB
                 M,       // 4 M
                 N,       // 5 N
                 K,       // 6 K
                 1.,           // 7 ALPHA
                 A.ptr<double>(),//8 A
                 A.step1(),        //9 LDA
                 B.ptr<double>(),//10 B
                 B.step1(),        //11 LDB
                 0.,            //12 BETA
                 C.ptr<double>(),//13 C
                 C.step1());       //14 LDC
}

而且每件事都运作良好。在没有额外的多线程或分而治之的方法的情况下，我能够将我的代码一步的处理时间从 150 毫秒减少到 500 微秒。所以它为我解决了所有问题 :)。

关于opencv - 将 OpenCV 的 Mat 容器与用于矩阵乘法的 blas 接口(interface)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/37624459/

24

4

0

文章推荐： node.js - 无法在谷歌应用程序引擎上运行nodejs项目

文章推荐： css - 如何通过 smacss 方法构建所有元素样式？

文章推荐： node.js - expressjs/nodejs 通用路由与通配符冲突

文章推荐： html - 为什么右浮动会影响其下方元素的布局？

opencv - 如何删除 openCV
我正在尝试从我的系统中完全删除 opencv。我试图学习 ROS，而在教程中我遇到了一个问题。创建空工作区后，我调用catkin_make 它给出了一个常见错误，我在 answers.ros 中搜索并
opencv - opencv warpaffine崩溃
我在尝试逐步转移对warpAffine的调用时遇到崩溃(不是异常): void rotateImage( const Mat& source, double degree, Mat& output )
opencv - opencv gpu中的错误处理
如何处理opencv gpu异常？是否有用于opencvgpu异常处理的特定错误代码集api？我尝试了很多搜索，但只有1个错误代码，即CV_GpuNotSupported。请帮帮我。最佳答案虽
opencv - [OpenCV]如何将轮廓固定为矩形？
笔记我是 OpenCV(或计算机视觉)的新手，所以告诉我搜索查询会很有帮助! 我想问什么我想编写一个从图片中提取名片的程序。我能够提取粗略的轮廓，但反射光会变成噪点，我无法提取准确的轮廓。请告诉
opencv - OpenCV 2二进制转换
我想根据像素的某个阈值将Mono16类型的Mat转换为二进制图像。我尝试使用以下内容: 阈值(img，ret，0.1，1，CV_THRESH_BINARY); 尝试编译时，出现make错误，提示: 错
opencv - OpenCV GPU卷积功能和缺少的边框
我对使用GPU加速的OpenCV中的卷积函数有疑问。使用GPU的卷积速度大约快3.5 运行时: convolve(src_32F, kernel, cresult, false, cbuffer);
opencv - OpenCV-CirclesGridFinder的文档
我正在尝试使用非对称圆圈网格执行相机校准。我通常找不到适合CirclesGridFinder的文档，尤其是findHoles()函数的文档。如果您有关于此功能如何工作以及其参数含义的信息，将不胜感
opencv - 投影仪和 OpenCV
在计算机上绘图和在 OpenCV 的投影仪上投影之间有什么区别吗？一种选择是投影显示所有内容的计算机屏幕。但也许也有这样的选择，即在投影仪上精确地绘制和投影图像，仅使用计算机作为计算机器。如果我能做
opencv - 如何停止for循环(OpenCV)
我将Processing(processing.org)用于需要人脸跟踪的项目。现在的问题是由于for循环，程序将耗尽内存。我想停止循环或至少解决内存不足的问题。这是代码。 import hyperm
opencv - cvSobel问题-opencv
我有下面的代码: // Image Processing.cpp : Defines the entry point for the console application. // //Save
opencv - opencv，模板匹配
我正在为某些项目使用opencv。并有应解决的任务。任务很简单。我有一张主图片，并且有一个模板，而不是将主图片与模板进行比较。我使用matchTemplate()函数。我只是好奇一下。在文档中，我
opencv - 尝试创建我的Haartraining OpenCV
我正在尝试使用以下命令创建级联分类器: haartraining -data haarcascade -vec samples.vec -bg negatives.dat -nstages 20 -n
opencv - OpenCV:检索轮廓中心的颜色
我试图使用OpenCV检测黑色图像中一组形状的颜色，为此我使用了Canny检测。但是，颜色输出总是返回为黑色。 std::vector > Asteroids::DetectPoints(const
opencv - OpenCV:如何使用cvSobel？
我正在尝试使用OpenCv 2.4.5从边缘查找渐变方向，但是我在使用cvSobel()时遇到问题，以下是错误消息和我的代码。我在某处读到它可能是由于浮点(??)之间的转换，但我不知道如何解决它。有帮
opencv - OpenCV:如何通过不同的角度使用真实场景的图像比较特征检测器和提取器的性能？
我正在尝试构建循环关闭算法，但是在开始开发之前，我想测试哪种功能描述符在真实数据集上效果更好。我有两个在两个方向拍摄的走廊图像，一个进入房间，另一个离开同一个房间。因此它们代表相同的场景，但具有2个
opencv - 比较没有白色的直方图包括 OpenCV
有没有一种方法可以比较直方图，但例如要排除白色，因此白色不会影响比较。最佳答案白色像素有饱和度 , S = 0 .因此，在创建直方图时很容易从计数中删除白色像素。请执行下列操作: 从 BGR 转
opencv - OpenCV-饱和像素
就像本主题的标题一样，如何在OpenCV中确定图像的特定像素(灰度或彩色)是否饱和(例如，亮度过高)？先感谢您。最佳答案根据定义，饱和像素是指与强度(即灰度值或颜色分量之一)等于255相关联的像
opencv - OpenCV-反卷积中的边界伪像
我是OpenCV的新用户，正在从事大学项目。程序会获取输入图像，对其进行综合模糊处理，然后对其进行模糊处理。当对合成模糊图像进行反卷积时，会生成边界伪像，因为...好吧，到目前为止，我还没有实现边界条
opencv - OpenCv detectMultiScale尺度搜索算法
我想知道OpenCV是haar特征还是lbp是在多尺度搜索过程中缩放图像还是像论文中提到的那样缩放特征本身？编辑:事实证明，检测器可以缩放图像，而不是功能。有人知道为什么吗？通过缩放功能可以更快。
opencv - OpenCV SVM培训
我在openCv中使用SVM.train命令(已定义了适当的参数)。接下来，我要使用我的算法进行分类，而不是使用svm.predict。可能吗？我可以访问训练时生成的支持 vector 吗？如果是这

首页

博学

6Ren·AI

商城

opencv - 将 OpenCV 的 Mat 容器与用于矩阵乘法的 blas 接口(interface)