OpenImage冠军方案:在物体检测中为分类和回归任务使用各自独立的特征图

本文主要是介绍OpenImage冠军方案:在物体检测中为分类和回归任务使用各自独立的特征图,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

点击上方“AI公园”,关注公众号,选择加“星标“或“置顶”


导读

这篇文章来自商汤科技,是OpenImage竞赛的冠军方案,本文对物体检测中的分类和回归任务的冲突问题进行了重新的审视,并给出了一个为不同任务分别生成特征图的方案,取得了很好的效果。

摘要

自从Fast RCNN以来,物体检测中的分类和回归都是共享的一个head,但是,分类和回归实际上是两个不一样的任务,在空间中所关注的内容也是不一样的,所以,共享一个检测头会对性能有伤害。本文提出了一个方法,叫做task-aware spatial disentanglement(TSD),从一个共享的proposal中生成两个解耦的proposal,在COCO和Open Image上都有3个点的提升,效果非常好。这个方法也是OpenImage 2019比赛的第一名。

1. 介绍

IoUNet首先发现了分类和回归共享一个头会有冲突这个问题,他们发现了有些分类分数特别高的bbox反而在回归上不够准确。为了解决这个问题,他们引入了一个额外的head用来预测IOU,用作位置的置信度,然后把位置置信度和分类得分结合起来作为最终的分数。这在一定程度上缓解了这个问题,在空间上的不对齐的问题依然存在。Double-Head RCNN分别用两个分支来进行分类和回归,这在检测头的方面解决了不对齐的问题,但是由于送到这两个检测头中的是来自同一个RPN的给出的ROI,所以,依然存在特征层面的不对齐的问题。

我们对常用的全连接head进行了空间敏感特征图的可视化,如图1,可以明显看出来,分类和回归关注的区域是不一样的。

因此,我们提出了task-aware spatial disentanglement(TSD),目的就是在空间上将分类和回归的梯度流解耦。TSD在原来的proposal的基础上,生成了两个解耦的proposal,分别用于分类和回归任务。这个改动在使用原来的backbone的基础上提升了3个点,更进一步,我们提出了progressive constraint (PC)来增大TSD和原始的head之间的margin,这又带来1个点的提升。

总结一下,我们的贡献如下:

  • 深入研究了基于ROI的检测器的性能壁垒,发现了制约其性能的原因。

  • 我们提出了一个简单的操作,叫做task-aware spatial disentanglement (TSD),用来解决任务间的冲突问题,通过这个操作,可以为不同的任务产生和任务相关的特征表示,从而解决任务间的冲突问题。

  • 进一步提出了一个progressive constraint (PC)来增加TSD和传统的head之间的performance margin。

  • 在COCO和OpenImage数据集上验证了方法的有效性。

2. 方法

2.1 TSD

如图2所示,我们把矩形的proposal表示为P,groundtruth包围框表示为B,类别为y,传统的Faster RCNN在共享的P上进行分类和回归的优化:

其中,,其中,f(·)是特征提取器,C(·)和R(·)分别是将特征转化为分类和回归结果的函数,有些工作认为共享的f对于分类和回归不是最优的,于是把f分成了两个,fc和fr,虽然有了一定的提升,但是在特征空间维度上的冲突还是存在的。

我们的目的是在空间维度对不同的任务进行解耦,在TSD中,上面的式子可以写成:

其中,Pc和Pr是从同一个P中预测得到的。具体来说,TSD以P为输入,分别生成Pc和Pr用来做分类和回归,用于分类的特征图Fc和用于回归的特征图Fr通过两个并列的分支生成。

2.2 任务感知的空间解耦学习

我们的目的是从共享的P中学习到Pc和Pr,对于定位任务,我们设计了一个3层的全连接网络Fr,用来将P生成一个新的Pr,这个过程可以写成:

这个式子的意思是对于P中的每个位置,生成对应这个位置的偏移量,△R=(△x, △y),然后生成Pr:

这个式子的意思是对原始的proposal P中的每个像素的位置加一个偏移,得到新的像素点坐标,然后,在做ROI Pooling的时候,用插值的方法来做。

对于分类来说,也是类似的:

其中,Fc也是一个3层全连接,其中,Fr和Fc的第一层是共享的,为了减少参数量。在使用不规则的ROI Pc来生成特征图的时候,我们还可以使用deformable RoI pooling来实现:

这里,G(x,y)是位于(x,y)的网格,|G(x,y)|是这个网格中样本点的数量。

2.3 逐步约束

在训练的时候,TSD和双检测头可以联合训练,此外,我们还设计了一个progressive constraint(PC)来提升性能。PC的公式如下:

看起来很复杂,其实就是对加了偏移和不加偏移的两个特征图预测出来的类别置信度的差别加上一个margin。当置信度的提升大于这个margin的时候,这个值就是0,否则就是一个大于0的数。

对于位置的分支也是一样:

如果P是一个负样本的proposal,那么Mloc可以忽略。所以,总的loss可以写成:

3. 实验

3.1 消融实验

我们尝试了不同的解耦方式,如图3。

得到的结果如表1:

使用联合训练的效果:

PC的效果:

不同的生成衍生proposal的方法的效果:

超参数的设置,不同的m值的效果:

3.2 不同的backbone的效果

3.3 应用到Mask-RCNN上的效果

3.4 在OpenImage上的效果

3.5 对比其他的SOTA

3.6 分析与讨论

不同的IOU要求下的表现

不同的尺度下的表现

TSD到底学到了什么?我们可以看看对比与双head,我们的可视化结果:

—END—

论文链接:https://arxiv.org/pdf/2003.07540.pdf

请长按或扫描二维码关注本公众号

喜欢的话,请给我个在看吧

这篇关于OpenImage冠军方案:在物体检测中为分类和回归任务使用各自独立的特征图的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1080739

相关文章

Conda与Python venv虚拟环境的区别与使用方法详解

《Conda与Pythonvenv虚拟环境的区别与使用方法详解》随着Python社区的成长,虚拟环境的概念和技术也在不断发展,:本文主要介绍Conda与Pythonvenv虚拟环境的区别与使用... 目录前言一、Conda 与 python venv 的核心区别1. Conda 的特点2. Python v

Spring Boot中WebSocket常用使用方法详解

《SpringBoot中WebSocket常用使用方法详解》本文从WebSocket的基础概念出发,详细介绍了SpringBoot集成WebSocket的步骤,并重点讲解了常用的使用方法,包括简单消... 目录一、WebSocket基础概念1.1 什么是WebSocket1.2 WebSocket与HTTP

C#中Guid类使用小结

《C#中Guid类使用小结》本文主要介绍了C#中Guid类用于生成和操作128位的唯一标识符,用于数据库主键及分布式系统,支持通过NewGuid、Parse等方法生成,感兴趣的可以了解一下... 目录前言一、什么是 Guid二、生成 Guid1. 使用 Guid.NewGuid() 方法2. 从字符串创建

Knife4j+Axios+Redis前后端分离架构下的 API 管理与会话方案(最新推荐)

《Knife4j+Axios+Redis前后端分离架构下的API管理与会话方案(最新推荐)》本文主要介绍了Swagger与Knife4j的配置要点、前后端对接方法以及分布式Session实现原理,... 目录一、Swagger 与 Knife4j 的深度理解及配置要点Knife4j 配置关键要点1.Spri

Python使用python-can实现合并BLF文件

《Python使用python-can实现合并BLF文件》python-can库是Python生态中专注于CAN总线通信与数据处理的强大工具,本文将使用python-can为BLF文件合并提供高效灵活... 目录一、python-can 库:CAN 数据处理的利器二、BLF 文件合并核心代码解析1. 基础合

Python使用OpenCV实现获取视频时长的小工具

《Python使用OpenCV实现获取视频时长的小工具》在处理视频数据时,获取视频的时长是一项常见且基础的需求,本文将详细介绍如何使用Python和OpenCV获取视频时长,并对每一行代码进行深入解析... 目录一、代码实现二、代码解析1. 导入 OpenCV 库2. 定义获取视频时长的函数3. 打开视频文

Spring IoC 容器的使用详解(最新整理)

《SpringIoC容器的使用详解(最新整理)》文章介绍了Spring框架中的应用分层思想与IoC容器原理,通过分层解耦业务逻辑、数据访问等模块,IoC容器利用@Component注解管理Bean... 目录1. 应用分层2. IoC 的介绍3. IoC 容器的使用3.1. bean 的存储3.2. 方法注

Python内置函数之classmethod函数使用详解

《Python内置函数之classmethod函数使用详解》:本文主要介绍Python内置函数之classmethod函数使用方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录1. 类方法定义与基本语法2. 类方法 vs 实例方法 vs 静态方法3. 核心特性与用法(1编程客

Linux中压缩、网络传输与系统监控工具的使用完整指南

《Linux中压缩、网络传输与系统监控工具的使用完整指南》在Linux系统管理中,压缩与传输工具是数据备份和远程协作的桥梁,而系统监控工具则是保障服务器稳定运行的眼睛,下面小编就来和大家详细介绍一下它... 目录引言一、压缩与解压:数据存储与传输的优化核心1. zip/unzip:通用压缩格式的便捷操作2.

使用Python实现可恢复式多线程下载器

《使用Python实现可恢复式多线程下载器》在数字时代,大文件下载已成为日常操作,本文将手把手教你用Python打造专业级下载器,实现断点续传,多线程加速,速度限制等功能,感兴趣的小伙伴可以了解下... 目录一、智能续传:从崩溃边缘抢救进度二、多线程加速:榨干网络带宽三、速度控制:做网络的好邻居四、终端交互