opencv - 使用 ARM NEON 的快速高斯模糊图像滤波器-6ren

opencv - 使用 ARM NEON 的快速高斯模糊图像滤波器

转载作者：太空宇宙更新时间：2023-11-03 20:56:08

46

4

我正在尝试制作高斯模糊图像过滤器的移动快速版本。

我读过其他问题，例如:Fast Gaussian blur on unsigned char image- ARM Neon Intrinsics- iOS Dev

出于我的目的，我只需要一个固定大小 (7x7) 的固定 sigma (2) 高斯滤波器。

因此，在针对 ARM NEON 进行优化之前，我在 C++ 中实现了 1D Gaussian Kernel，并直接在移动环境(Android 和 NDK)中与 OpenCV GaussianBlur() 方法比较了性能。这样一来，代码的优化就会简单得多。

然而结果是我的实现比 OpenCV4Android 版本慢 10 倍。我读过 OpenCV4 Tegra 优化了 GaussianBlur 实现，但我不认为标准 OpenCV4Android 有这些优化，那么为什么我的代码这么慢？

这是我的实现(注意:在边界附近应用滤镜时，reflect101 用于像素反射):

Mat myGaussianBlur(Mat src){
    Mat dst(src.rows, src.cols, CV_8UC1);
    Mat temp(src.rows, src.cols, CV_8UC1);
    float sum, x1, y1;

    // coefficients of 1D gaussian kernel with sigma = 2
    double coeffs[] = {0.06475879783, 0.1209853623, 0.1760326634, 0.1994711402, 0.1760326634, 0.1209853623, 0.06475879783};
    //Normalize coeffs
    float coeffs_sum = 0.9230247873f;
    for (int i = 0; i < 7; i++){
        coeffs[i] /= coeffs_sum;
    }

    // filter vertically
    for(int y = 0; y < src.rows; y++){
        for(int x = 0; x < src.cols; x++){
            sum = 0.0;
            for(int i = -3; i <= 3; i++){
                y1 = reflect101(src.rows, y - i);
                sum += coeffs[i + 3]*src.at<uchar>(y1, x);
            }
            temp.at<uchar>(y,x) = sum;
        }
    }

    // filter horizontally
    for(int y = 0; y < src.rows; y++){
        for(int x = 0; x < src.cols; x++){
            sum = 0.0;
            for(int i = -3; i <= 3; i++){
                x1 = reflect101(src.rows, x - i);
                sum += coeffs[i + 3]*temp.at<uchar>(y, x1);
            }
            dst.at<uchar>(y,x) = sum;
        }
    }

    return dst;
}

最佳答案

正如@PaulR 指出的那样，这里的问题的很大一部分是算法过于精确。通常最好不要让您的系数表比您的数据更精确。在这种情况下，由于您似乎正在处理 uchar 数据，因此您将大致使用 8 位系数表。

在您的 NEON 实现中保持较小的权重尤其重要，因为您的算法越窄，您一次可以处理的 channel 就越多。

除此之外，第一个突出的主要减速是在主循环中使用图像边缘反射代码。这将使大部分工作的效率降低，因为在这种情况下通常不需要做任何特殊的事情。

如果您在边缘附近使用特殊版本的循环可能会更好，然后当您安全时使用不调用该循环的简化内部循环 reflect101()函数。

其次(与原型(prototype)代码更相关)是可以在应用加权函数之前将窗口的两翼加在一起，因为该表在两侧包含相同的系数。

sum = src.at<uchar>(y1, x) * coeffs[3];
for(int i = -3; i < 0; i++) {
    int tmp = src.at<uchar>(y + i, x) + src.at<uchar>(y - i, x);
    sum += coeffs[i + 3] * tmp;
}

这为您节省了每个像素的 6 次乘法运算，这是朝着围绕控制溢出条件进行一些其他优化迈出的一步。

然后还有一些与内存系统相关的其他问题。

两次通过的方法在原则上是好的，因为它可以让您免于执行大量的重新计算。不幸的是，它会将有用的数据推出 L1 缓存，这会使一切变慢。这也意味着当您将结果写入内存时，您正在量化中间总和，这会降低精度。

当您将此代码转换为 NEON 时，您需要关注的一件事是尝试将您的工作集保留在寄存器文件中，但不要在它们被完全利用之前丢弃计算。

当人们确实使用两次传递时，中间数据通常会被转置——也就是说，一列输入变成一行输出。

这是因为 CPU 真的不喜欢在输入图像的多行中获取少量数据。如果你收集一堆水平像素并过滤它们，它会更有效率(因为缓存的工作方式)。如果临时缓冲区被转置，那么第二遍也会收集一堆水平点(它们在原始方向上是垂直的)并再次转置其输出以使其以正确的方式出现。

如果您进行优化以保持工作集本地化，那么您可能不需要这种转换技巧，但值得了解它以便您可以为自己设置健康的基准性能。不幸的是，像这样的本地化确实会迫使您返回到非最佳内存获取，但是对于更广泛的数据类型，可以减轻这种损失。

关于opencv - 使用 ARM NEON 的快速高斯模糊图像滤波器，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/17486025/

46

4

0

文章推荐： image - OpenCV:从文件夹中读取图像系列

文章推荐： python - 从 Python 脚本运行 ImageJ 宏错误未找到

文章推荐： opencv - 人体全身检测 : contour rather than rectangle

opencv - 如何删除 openCV
我正在尝试从我的系统中完全删除 opencv。我试图学习 ROS，而在教程中我遇到了一个问题。创建空工作区后，我调用catkin_make 它给出了一个常见错误，我在 answers.ros 中搜索并
opencv - opencv warpaffine崩溃
我在尝试逐步转移对warpAffine的调用时遇到崩溃(不是异常): void rotateImage( const Mat& source, double degree, Mat& output )
opencv - opencv gpu中的错误处理
如何处理opencv gpu异常？是否有用于opencvgpu异常处理的特定错误代码集api？我尝试了很多搜索，但只有1个错误代码，即CV_GpuNotSupported。请帮帮我。最佳答案虽
opencv - [OpenCV]如何将轮廓固定为矩形？
笔记我是 OpenCV(或计算机视觉)的新手，所以告诉我搜索查询会很有帮助! 我想问什么我想编写一个从图片中提取名片的程序。我能够提取粗略的轮廓，但反射光会变成噪点，我无法提取准确的轮廓。请告诉
opencv - OpenCV 2二进制转换
我想根据像素的某个阈值将Mono16类型的Mat转换为二进制图像。我尝试使用以下内容: 阈值(img，ret，0.1，1，CV_THRESH_BINARY); 尝试编译时，出现make错误，提示: 错
opencv - OpenCV GPU卷积功能和缺少的边框
我对使用GPU加速的OpenCV中的卷积函数有疑问。使用GPU的卷积速度大约快3.5 运行时: convolve(src_32F, kernel, cresult, false, cbuffer);
opencv - OpenCV-CirclesGridFinder的文档
我正在尝试使用非对称圆圈网格执行相机校准。我通常找不到适合CirclesGridFinder的文档，尤其是findHoles()函数的文档。如果您有关于此功能如何工作以及其参数含义的信息，将不胜感
opencv - 投影仪和 OpenCV
在计算机上绘图和在 OpenCV 的投影仪上投影之间有什么区别吗？一种选择是投影显示所有内容的计算机屏幕。但也许也有这样的选择，即在投影仪上精确地绘制和投影图像，仅使用计算机作为计算机器。如果我能做
opencv - 如何停止for循环(OpenCV)
我将Processing(processing.org)用于需要人脸跟踪的项目。现在的问题是由于for循环，程序将耗尽内存。我想停止循环或至少解决内存不足的问题。这是代码。 import hyperm
opencv - cvSobel问题-opencv
我有下面的代码: // Image Processing.cpp : Defines the entry point for the console application. // //Save
opencv - opencv，模板匹配
我正在为某些项目使用opencv。并有应解决的任务。任务很简单。我有一张主图片，并且有一个模板，而不是将主图片与模板进行比较。我使用matchTemplate()函数。我只是好奇一下。在文档中，我
opencv - 尝试创建我的Haartraining OpenCV
我正在尝试使用以下命令创建级联分类器: haartraining -data haarcascade -vec samples.vec -bg negatives.dat -nstages 20 -n
opencv - OpenCV:检索轮廓中心的颜色
我试图使用OpenCV检测黑色图像中一组形状的颜色，为此我使用了Canny检测。但是，颜色输出总是返回为黑色。 std::vector > Asteroids::DetectPoints(const
opencv - OpenCV:如何使用cvSobel？
我正在尝试使用OpenCv 2.4.5从边缘查找渐变方向，但是我在使用cvSobel()时遇到问题，以下是错误消息和我的代码。我在某处读到它可能是由于浮点(??)之间的转换，但我不知道如何解决它。有帮
opencv - OpenCV:如何通过不同的角度使用真实场景的图像比较特征检测器和提取器的性能？
我正在尝试构建循环关闭算法，但是在开始开发之前，我想测试哪种功能描述符在真实数据集上效果更好。我有两个在两个方向拍摄的走廊图像，一个进入房间，另一个离开同一个房间。因此它们代表相同的场景，但具有2个
opencv - 比较没有白色的直方图包括 OpenCV
有没有一种方法可以比较直方图，但例如要排除白色，因此白色不会影响比较。最佳答案白色像素有饱和度 , S = 0 .因此，在创建直方图时很容易从计数中删除白色像素。请执行下列操作: 从 BGR 转
opencv - OpenCV-饱和像素
就像本主题的标题一样，如何在OpenCV中确定图像的特定像素(灰度或彩色)是否饱和(例如，亮度过高)？先感谢您。最佳答案根据定义，饱和像素是指与强度(即灰度值或颜色分量之一)等于255相关联的像
opencv - OpenCV-反卷积中的边界伪像
我是OpenCV的新用户，正在从事大学项目。程序会获取输入图像，对其进行综合模糊处理，然后对其进行模糊处理。当对合成模糊图像进行反卷积时，会生成边界伪像，因为...好吧，到目前为止，我还没有实现边界条
opencv - OpenCv detectMultiScale尺度搜索算法
我想知道OpenCV是haar特征还是lbp是在多尺度搜索过程中缩放图像还是像论文中提到的那样缩放特征本身？编辑:事实证明，检测器可以缩放图像，而不是功能。有人知道为什么吗？通过缩放功能可以更快。
opencv - OpenCV SVM培训
我在openCv中使用SVM.train命令(已定义了适当的参数)。接下来，我要使用我的算法进行分类，而不是使用svm.predict。可能吗？我可以访问训练时生成的支持 vector 吗？如果是这

首页

博学

6Ren·AI

商城

opencv - 使用 ARM NEON 的快速高斯模糊图像滤波器