opencv - Horn-Schunck 光流实现问题-6ren

opencv - Horn-Schunck 光流实现问题

转载作者：行者123 更新时间：2023-12-02 16:12:47

我正在尝试通过 NumPy 和 OpenCV 实现 Horn-Schunck 光流算法我用 Horn-Schunck method on wiki和 original paper

但是我的实现在以下简单示例中失败了

第 1 帧:

[[  0   0   0   0   0   0   0   0   0   0]
 [  0 255 255   0   0   0   0   0   0   0]
 [  0 255 255   0   0   0   0   0   0   0]
 [  0   0   0   0   0   0   0   0   0   0]
 [  0   0   0   0   0   0   0   0   0   0]]

第 2 帧:

[[  0   0   0   0   0   0   0   0   0   0]
 [  0   0   0 255 255   0   0   0   0   0]
 [  0   0   0 255 255   0   0   0   0   0]
 [  0   0   0   0   0   0   0   0   0   0]
 [  0   0   0   0   0   0   0   0   0   0]]

这只是在第 2 帧上移动 2 个像素的白色小矩形我的实现产生以下流程流程的 U 部分(我将 np.round 应用于流程的每个部分。原始值几乎相同):

[[ 1.  1.  1.  1.  1.  1.  1.  1.  1.  1.]
 [ 1.  1.  1.  1.  1.  1.  1.  1.  1.  1.]
 [ 1.  1.  1.  1.  1.  1.  1.  1.  1.  1.]
 [ 1.  1.  1.  1.  1.  1.  1.  1.  1.  1.]
 [ 1.  1.  1.  1.  1.  1.  1.  1.  1.  1.]]

V部分流程:

[[ 0.  1.  0. -1. -0.  0.  0.  0.  0.  0.]
 [-0. -0.  0.  0.  0.  0.  0.  0.  0.  0.]
 [-0. -1. -0.  1.  0.  0.  0.  0.  0.  0.]
 [-0. -0. -0.  0.  0.  0.  0.  0.  0.  0.]
 [-0. -0. -0.  0.  0.  0.  0.  0.  0.  0.]]

看起来这个流程不正确(因为如果我将 frame2 的每个像素都朝相应的流程组件的方向移动，我永远不会得到 frame1)我的实现在真实图像上也失败了

但是如果我将矩形向右(或向左或向上或向下)移动 1 个像素，我的实现会产生:U部分流程:

[[1 1 1 .....]
[1 1 1 .....]
......
[1 1 1 .....]]

V部分流程:

[[0 0 0 .....]
[0 0 0 .....]
......
[0 0 0 .....]]

我认为这个流程是正确的，因为我可以通过以下过程重建第 1 帧

def translateBrute(img, u, v):
    res = np.zeros_like(img)
    u = np.round(u).astype(np.int)
    v = np.round(v).astype(np.int)
    for i in xrange(img.shape[0]):
        for j in xrange(img.shape[1]):
            res[i, j] = takePixel(img, i + v[i, j], j + u[i, j])
    return res

其中 takePixel 是一个简单的函数，如果输入坐标位于图像内部则返回像素强度，否则返回图像边界上的强度

这是我的实现

import cv2
import sys
import numpy as np

def takePixel(img, i, j):
    i = i if i >= 0 else 0
    j = j if j >= 0 else 0    
    i = i if i < img.shape[0] else img.shape[0] - 1
    j = j if j < img.shape[1] else img.shape[1] - 1
    return img[i, j]

#Numerical derivatives from original paper: http://people.csail.mit.edu/bkph/papers/Optical_Flow_OPT.pdf
def xDer(img1, img2):
    res = np.zeros_like(img1)
    for i in xrange(res.shape[0]):
        for j in xrange(res.shape[1]):
            sm = 0
            sm += takePixel(img1, i,     j + 1) - takePixel(img1, i,     j)
            sm += takePixel(img1, i + 1, j + 1) - takePixel(img1, i + 1, j)
            sm += takePixel(img2, i,     j + 1) - takePixel(img2, i,     j)
            sm += takePixel(img2, i + 1, j + 1) - takePixel(img2, i + 1, j)
            sm /= 4.0
            res[i, j] = sm
    return res

def yDer(img1, img2):
    res = np.zeros_like(img1)
    for i in xrange(res.shape[0]):
        for j in xrange(res.shape[1]):
            sm = 0
            sm += takePixel(img1, i + 1, j    ) - takePixel(img1, i, j    )
            sm += takePixel(img1, i + 1, j + 1) - takePixel(img1, i, j + 1)
            sm += takePixel(img2, i + 1, j    ) - takePixel(img2, i, j    )
            sm += takePixel(img2, i + 1, j + 1) - takePixel(img2, i, j + 1)
            sm /= 4.0
            res[i, j] = sm
    return res

def tDer(img, img2):
    res = np.zeros_like(img)
    for i in xrange(res.shape[0]):
        for j in xrange(res.shape[1]):
            sm = 0
            for ii in xrange(i, i + 2):
                for jj in xrange(j, j + 2):
                    sm += takePixel(img2, ii, jj) - takePixel(img, ii, jj)
            sm /= 4.0
            res[i, j] = sm
    return res

averageKernel = np.array([[ 0.08333333,  0.16666667,  0.08333333],
                          [ 0.16666667,  0.        ,  0.16666667],
                          [ 0.08333333,  0.16666667,  0.08333333]], dtype=np.float32)
#average intensity around flow in point i,j. I use filter2D to improve performance. 
def average(img):
    return cv2.filter2D(img.astype(np.float32), -1, averageKernel)

def translateBrute(img, u, v):
    res = np.zeros_like(img)
    u = np.round(u).astype(np.int)
    v = np.round(v).astype(np.int)
    for i in xrange(img.shape[0]):
        for j in xrange(img.shape[1]):
            res[i, j] = takePixel(img, i + v[i, j], j + u[i, j])
    return res

#Core of algorithm. Iterative scheme from wiki: https://en.wikipedia.org/wiki/Horn%E2%80%93Schunck_method#Mathematical_details
def hornShunckFlow(img1, img2, alpha):
    img1 = img1.astype(np.float32)
    img2 = img2.astype(np.float32)

    Idx = xDer(img1, img2)
    Idy = yDer(img1, img2)
    Idt = tDer(img1, img2)

    u = np.zeros_like(img1)
    v = np.zeros_like(img1)

    #100 iterations enough for small example
    for iteration in xrange(100):
        u0 = np.copy(u)
        v0 = np.copy(v)

        uAvg = average(u0)
        vAvg = average(v0)
        # '*', '+', '/' operations in numpy works component-wise
        u = uAvg - 1.0/(alpha**2 + Idx**2 + Idy**2) * Idx * (Idx * uAvg + Idy * vAvg + Idt)
        v = vAvg - 1.0/(alpha**2 + Idx**2 + Idy**2) * Idy * (Idx * uAvg + Idy * vAvg + Idt)
        if  iteration % 10 == 0:
            print 'iteration', iteration, np.linalg.norm(u - u0) + np.linalg.norm(v - v0)

    return u, v

if __name__ == '__main__':
    img1c = cv2.imread(sys.argv[1])
    img2c = cv2.imread(sys.argv[2])
    img1g = cv2.cvtColor(img1c, cv2.COLOR_BGR2GRAY)
    img2g = cv2.cvtColor(img2c, cv2.COLOR_BGR2GRAY)

    u, v = hornShunckFlow(img1g, img2g, 0.1)
    imgRes = translateBrute(img2g, u, v)
    cv2.imwrite('res.png', imgRes)
    print img1g
    print translateBrute(img2g, u, v)

优化方案取自wikipedia和数值导数取自原始论文。

有人知道为什么我的实现会产生错误的流程吗？如果需要，我可以提供任何其他信息

PS 抱歉我的英语不好

更新:我实现 Horn-Schunck 成本函数

def grad(img):
    Idx = cv2.filter2D(img, -1, np.array([
            [-1, -2, -1], 
            [ 0,  0,  0], 
            [ 1,  2,  1]], dtype=np.float32))
    Idy = cv2.filter2D(img, -1, np.array([
            [-1, 0, 1], 
            [-2, 0, 2], 
            [-1, 0, 1]], dtype=np.float32))
    return Idx, Idy

def hornShunckCost(Idx, Idy, Idt, u, v, alpha):
    #return sum(sum(It**2))
    udx, udy = grad(u)
    vdx, vdy = grad(v)
    return (sum(sum((Idx*u + Idy*v + Idt)**2)) + 
            (alpha**2)*(sum(sum(udx**2)) +
                        sum(sum(udy**2)) +
                        sum(sum(vdx**2)) +
                        sum(sum(vdy**2))
                ))

并在迭代中检查此函数的值

if  iteration % 10 == 0:
            print 'iter', iteration, np.linalg.norm(u - u0) + np.linalg.norm(v - v0)
            print hornShunckCost(Idx, Idy, Idt, u, v, alpha)

如果我使用一个简单的例子，矩形已经移动了一个像素，一切正常:成本函数的值在每一步都减少。但是在示例中，矩形移动了两个像素，成本函数的值在每一步都增加。算法的这种行为真的很奇怪也许我选择了不正确的方式来计算成本函数。

最佳答案

我忘记了一个事实，即经典的 Horn-Schunck 方案使用线性化数据项 (I1(x, y) - I2(x + u(x, y), y + v(x, y)))。这种线性化使优化变得容易，但不允许大位移

要处理大位移，有下一种方法 Pyramidal Horn-Schunck

关于opencv - Horn-Schunck 光流实现问题，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/27904217/

文章推荐： haskell - 避免在 Snap 中进行链式查找的 case 表达式

文章推荐： JavaScript 将数字生成值添加到当前设置值上

文章推荐： c++ - 多态中的函数对象

opencv - 如何删除 openCV
我正在尝试从我的系统中完全删除 opencv。我试图学习 ROS，而在教程中我遇到了一个问题。创建空工作区后，我调用catkin_make 它给出了一个常见错误，我在 answers.ros 中搜索并
opencv - opencv warpaffine崩溃
我在尝试逐步转移对warpAffine的调用时遇到崩溃(不是异常): void rotateImage( const Mat& source, double degree, Mat& output )
opencv - opencv gpu中的错误处理
如何处理opencv gpu异常？是否有用于opencvgpu异常处理的特定错误代码集api？我尝试了很多搜索，但只有1个错误代码，即CV_GpuNotSupported。请帮帮我。最佳答案虽
opencv - [OpenCV]如何将轮廓固定为矩形？
笔记我是 OpenCV(或计算机视觉)的新手，所以告诉我搜索查询会很有帮助! 我想问什么我想编写一个从图片中提取名片的程序。我能够提取粗略的轮廓，但反射光会变成噪点，我无法提取准确的轮廓。请告诉
opencv - OpenCV 2二进制转换
我想根据像素的某个阈值将Mono16类型的Mat转换为二进制图像。我尝试使用以下内容: 阈值(img，ret，0.1，1，CV_THRESH_BINARY); 尝试编译时，出现make错误，提示: 错
opencv - OpenCV GPU卷积功能和缺少的边框
我对使用GPU加速的OpenCV中的卷积函数有疑问。使用GPU的卷积速度大约快3.5 运行时: convolve(src_32F, kernel, cresult, false, cbuffer);
opencv - OpenCV-CirclesGridFinder的文档
我正在尝试使用非对称圆圈网格执行相机校准。我通常找不到适合CirclesGridFinder的文档，尤其是findHoles()函数的文档。如果您有关于此功能如何工作以及其参数含义的信息，将不胜感
opencv - 投影仪和 OpenCV
在计算机上绘图和在 OpenCV 的投影仪上投影之间有什么区别吗？一种选择是投影显示所有内容的计算机屏幕。但也许也有这样的选择，即在投影仪上精确地绘制和投影图像，仅使用计算机作为计算机器。如果我能做
opencv - 如何停止for循环(OpenCV)
我将Processing(processing.org)用于需要人脸跟踪的项目。现在的问题是由于for循环，程序将耗尽内存。我想停止循环或至少解决内存不足的问题。这是代码。 import hyperm
opencv - cvSobel问题-opencv
我有下面的代码: // Image Processing.cpp : Defines the entry point for the console application. // //Save
opencv - opencv，模板匹配
我正在为某些项目使用opencv。并有应解决的任务。任务很简单。我有一张主图片，并且有一个模板，而不是将主图片与模板进行比较。我使用matchTemplate()函数。我只是好奇一下。在文档中，我
opencv - 尝试创建我的Haartraining OpenCV
我正在尝试使用以下命令创建级联分类器: haartraining -data haarcascade -vec samples.vec -bg negatives.dat -nstages 20 -n
opencv - OpenCV:检索轮廓中心的颜色
我试图使用OpenCV检测黑色图像中一组形状的颜色，为此我使用了Canny检测。但是，颜色输出总是返回为黑色。 std::vector > Asteroids::DetectPoints(const
opencv - OpenCV:如何使用cvSobel？
我正在尝试使用OpenCv 2.4.5从边缘查找渐变方向，但是我在使用cvSobel()时遇到问题，以下是错误消息和我的代码。我在某处读到它可能是由于浮点(??)之间的转换，但我不知道如何解决它。有帮
opencv - OpenCV:如何通过不同的角度使用真实场景的图像比较特征检测器和提取器的性能？
我正在尝试构建循环关闭算法，但是在开始开发之前，我想测试哪种功能描述符在真实数据集上效果更好。我有两个在两个方向拍摄的走廊图像，一个进入房间，另一个离开同一个房间。因此它们代表相同的场景，但具有2个
opencv - 比较没有白色的直方图包括 OpenCV
有没有一种方法可以比较直方图，但例如要排除白色，因此白色不会影响比较。最佳答案白色像素有饱和度 , S = 0 .因此，在创建直方图时很容易从计数中删除白色像素。请执行下列操作: 从 BGR 转
opencv - OpenCV-饱和像素
就像本主题的标题一样，如何在OpenCV中确定图像的特定像素(灰度或彩色)是否饱和(例如，亮度过高)？先感谢您。最佳答案根据定义，饱和像素是指与强度(即灰度值或颜色分量之一)等于255相关联的像
opencv - OpenCV-反卷积中的边界伪像
我是OpenCV的新用户，正在从事大学项目。程序会获取输入图像，对其进行综合模糊处理，然后对其进行模糊处理。当对合成模糊图像进行反卷积时，会生成边界伪像，因为...好吧，到目前为止，我还没有实现边界条
opencv - OpenCv detectMultiScale尺度搜索算法
我想知道OpenCV是haar特征还是lbp是在多尺度搜索过程中缩放图像还是像论文中提到的那样缩放特征本身？编辑:事实证明，检测器可以缩放图像，而不是功能。有人知道为什么吗？通过缩放功能可以更快。
opencv - OpenCV SVM培训
我在openCv中使用SVM.train命令(已定义了适当的参数)。接下来，我要使用我的算法进行分类，而不是使用svm.predict。可能吗？我可以访问训练时生成的支持 vector 吗？如果是这

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

opencv - Horn-Schunck 光流实现问题