- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
在过去几年中,我从事的最有趣的项目之一是有关image processing的项目。目的是开发一个能够识别可口可乐“罐头”的系统(请注意,我强调的是“罐头”一词,稍后您会看到原因)。您可以在下面看到一个示例,该示例在带有刻度和旋转的绿色矩形中可以识别。
对项目的一些限制:
背景可能非常嘈杂。
罐可以有任何比例,旋转或什至取向(在合理范围内)。
图像可能有一定程度的模糊性(轮廓可能不完全笔直)。
图像中可能有可口可乐瓶,该算法只能检测到罐头!
图像的亮度可能相差很大(因此您不能过多地依赖颜色检测)。
罐子可以部分隐藏在侧面或中间,也可以部分隐藏在瓶子后面。
图像中根本没有罐子,在这种情况下,您什么也找不到,只写了一条信息。
因此,您可能会遇到诸如此类的棘手事情(在这种情况下,我的算法完全失败了):
我前一段时间做了这个项目,并且做得很有趣,并且实现得很好。以下是有关我的实现的一些详细信息:
语言:使用OpenCV库在C ++中完成。
预处理:对于图像预处理,即将图像转换为更原始的形式以提供给算法,我使用了2种方法:
将色域从RGB更改为HSV,并基于“红色”色调进行过滤,饱和度高于特定阈值以避免产生类似橙色的颜色,而对低值进行过滤以避免产生深色。最终结果是一个二进制的黑白图像,其中所有白色像素将代表与该阈值匹配的像素。显然,图像中仍然有很多废话,但这减少了必须处理的尺寸数。
使用中值滤波进行噪声滤波(获取所有邻居的中值像素值,然后用该值替换像素)以减少噪声。
经过2个先前步骤后,使用Canny Edge Detection Filter获取所有项目的轮廓。
算法:我为此任务选择的算法本身取材于this关于特征提取的出色书籍,并称为Generalized Hough Transform(与常规的Hough变换完全不同)。它基本上说了几件事:
您可以在不知道其解析方程的情况下描述空间物体(此处就是这种情况)。
它可以抵抗诸如缩放和旋转之类的图像变形,因为它将基本上测试图像的缩放因子和旋转因子的每种组合。
它使用算法将“学习”的基本模型(模板)。
轮廓图像中剩余的每个像素将投票给另一个像素,该像素根据其从模型中学到的内容,应该是对象的中心(就重力而言)。
最后,您将获得投票的热图,例如,此处罐头轮廓的所有像素都将为其重力中心投票,因此在与像素相对应的同一像素中将有很多投票中心,将在热图上看到一个峰值,如下所示:
有了这些功能后,您就可以使用简单的基于阈值的启发式方法来确定中心像素的位置,从中可以得出比例尺和旋转角度,然后在其周围绘制一个小矩形(最终比例尺和旋转系数显然相对于您的原始模板)。理论上至少...
结果:现在,尽管这种方法在基本情况下可行,但在某些方面却严重缺乏:
太慢了!我的压力还不够。处理30张测试图像几乎需要整整一天的时间,这显然是因为我对旋转和平移具有非常高的缩放系数,因为某些罐非常小。
当瓶子出现在图像中时,它完全丢失了,并且由于某种原因几乎总是找到瓶子而不是罐子(也许是因为瓶子更大,因此像素更多,投票更多)
模糊图像也不是很好,因为投票最终以像素为中心在中心附近的任意位置,从而以非常嘈杂的热图结束。
实现了平移和旋转的不变性,但没有实现方向性,这意味着未识别未直接面对相机物镜的罐子。
您是否可以使用专有的OpenCV功能帮助我改善特定算法,以解决上述四个特定问题?
我希望有些人也能从中学到一些东西,毕竟我认为不仅提出问题的人应该学习。 :)
最佳答案
另一种方法是使用scale-invariant feature transform(SIFT)或Speeded Up Robust Features(SURF)提取特征(关键点)。
它在OpenCV 2.3.1中实现。
您可以使用Features2D + Homography to find a known object中的功能找到不错的代码示例
两种算法对于缩放和旋转都是不变的。由于它们可以使用功能,因此您也可以处理occlusion(只要有足够的关键点可见)。
图片来源:教程示例
SIFT的处理过程需要几百毫秒,SURF速度更快,但是不适用于实时应用。 ORB使用的FAST在旋转不变性方面较弱。
原始论文
SURF: Speeded Up Robust Features
Distinctive Image Featuresfrom Scale-Invariant Keypoints
ORB: an efficient alternative to SIFT or SURF
关于c++ - 图像处理:“可口可乐”识别的算法改进,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/31183201/
我对编码还比较陌生,但并非完全没有经验。处理有关金融计算器的学校作业。如果你们中的任何人可以查看我的代码以了解不良做法/可能的改进等,那就太好了。 我确实添加了一个“动画”启动(有很多 printf
小目标Trick 论文链接: https://paperswithcode.com/paper/slicing-aided-hyper-inference-and-fine-tuning 代码链接:h
if (firstPositionCpc && (firstPosition > 0 && firstPositionCpc 0 && topOfPageCpc 0 && firstPageCpc
我有 2 个表:“packages”和“items”。 “packages”有以下列:pack_id | item_id “items”有以下列......:item_id |输入 一个包可以有多个
我目前有一个 Pandas Dataframe,我在其中执行列之间的比较。我发现一种情况,在进行比较时存在空列,由于某种原因比较返回 else 值。我添加了一个额外的语句来将其清理为空。看看我是否可以
我正在处理一个查询,通过首先舍入它们的主要日期时间键来连接一个数据库中的多个表。数据库包含来自 openhab 的性能数据,每个表只有一个名为 Time 的主日期时间行和一个名为 Value 的值行。
问候 我有一个程序创建一个类的多个实例,在所有实例上运行相同的长时间运行的 Update 方法并等待完成。我从 this question 开始关注 Kev 的方法将更新添加到 ThreadPool.
我想在下学期的类(class)中取得领先,所以我制作了这个基本版本的 Blackjack 来开始理解 C 的基础知识,我希望您有任何想法可以帮助我更好地理解 C 和其正常的编码实践。 C 中的很多东西
我有一个要求,比如: 给定一个数组,其中包含随机数。需要输出元素出现的次数,有自带解决方案: var myArr = [3,2,1,2,3,1,4,5,4,6,7,7,9,1,123,0,123];
这是我的数据库项目。 表user_ select id, name from user_; id | name ----+---------- 1 | bartek 2 | bartek
我已经完成了一个小批量脚本来调整(动态)一些图像的大小: for a in *.{png,PNG,jpg,JPG,jpeg,JPEG,bmp,BMP} ; do convert "$a" -resiz
是否有更 pythonic 的方法来执行以下代码?我想在一行中完成 parsed_rows 是一个可以返回大小为 3 或 None 的元组的函数。 parsed_rows = [ parse_row(
关闭。这个问题是opinion-based .它目前不接受答案。 想要改进这个问题? 更新问题,以便 editing this post 可以用事实和引用来回答它. 关闭 9 年前。 Improv
下面的代码完成了我想要的,但还有其他更像 python 风格的方式吗? 文件格式: key1:value1,key2:value2,... key21:value21,key22:value22,..
如果两个英文单词只包含相同的字母,则它们是相似的。例如,food 和 good 不相似,但 dog 和 good 相似。 (如果A与B相似,则A中的所有字母都包含在B中,B中的所有字母都包含在A中。)
我有以下结构来表示二叉树: typedef struct node *pnode; typedef struct node { int val; pnode left; pnode
我有一个区域,它由受约束的 delaunay 三角剖分表示。我正在解决在两点之间寻找路径的问题。我正在使用 Marcelo Kallmann 提供的论文作为解决此问题的引用点。然而,而不是使用 Kal
如果我需要检查文本(字符串)中是否存在单词 A 或单词 B,如果我这样做会有性能差异: if(text.contains(wordA) || text.contains(wordB)) 要使用一些正则
Adjust To 我有上面这个简单的页面,上面有一个标签和一个文本框。我想在文本框中输入文本。 对我有帮助的 XPATH 是 //*[contains(tex
以下伪代码的elisp代码 if "the emacs version is less than 23.1.x" do something else something-else 写成 (if
我是一名优秀的程序员,十分优秀!