
全文共 1733 个字,阅读大概需要 3 分钟
来源:计算创意与艺术
ID: CompCreativityAndArt
Introduction
导读
本篇文章由中科院自动化所模式识别国家重点实验室多媒体计算团队带来,针对如何高效的提升检测器的检测精度与检测速度进行实验。该项工作与滴滴出行合作完成,并发表于国际顶级期刊IEEE Transactions on Image Processing。
01
检测任务之背景
面对复杂的现实检测事件,要求检测器拥有非常高的检测精度与非常快的检测速度。在现代检测器中,输入图像尺度极大地影响检测结果,可当极大地提升输入尺度时,会提高对计算设备显存的要求;降低图像尺度会不可避免地丢失信息。所以,探索如何高效地对大尺度图像进行检测非常有必要。

图1 尺度缩放对检测效果的影响
可以从上图(横轴代表图像短边大小,纵轴代表检测结果mAP)中得出结论:
在一定范围内,对图像进行上采样,可以提高检测效果;在同一尺度下,高分辨率图像的检测结果优于低分辨率图像。
因此,提出改进目标检测的两个方向:适当提高图像尺并引入高分辨率信息。
由于直接提高图像输入尺度极为耗费内存与计算开销,所以提出特征上采样方法代替输入图像上采样。
02
实验验证步骤
本段落进行实验,将目标检测框架分为特征表达Pfeat与检测器Pdet两部分,依次改变模型后再训练,结果如下:

表1 训练与测试不同尺度时的对比实验
结果表示,提高网络结构中的特征尺度可以提高模型检测性能,且被提高尺度的特征越靠近模型的输入,提高幅度越明显。但同样需要的内存与计算开销也越大。综合权衡速度与效果,选择在模型的第一个自下而上的特征提取之后引入特征上采样模块。
03
网络的提出
基于以上实验结论,提出自监督特征增强模块,从特征上采样与引入高分辨率信息两个方面提高模型检测性能。方法框架如下:

图2 基于自监督的特征增强网络
以FPN网络为基础,在之上引入引导式特征增强模块。该模块是自上而下的信息流,通过纵向、横向连接依次地产生各个尺度特征上采样结果。在最浅层的特征上采样后,引入引导特征损失函数,将获得的真实高分辨率特征作为监督信息,引导网络学习更加真实的高分辨率特征,同时将高分辨率信息引入网络。
整个网络目标函数为:

其中右侧前两项为Mask R-CNN网络损失函数,分别表示目标分类与回归损失函数,第三项为我们的辅助性目标函数,定义如下:


04
效果展示
下表为在MVD数据集上与其它经典方法的结果对比,其中SFANet是本课题提出的方法,在更小的图像输入尺度下,取得了更好的效果。

表2 训练与测试不同尺度时的对比实验
下图,是本课题提出的方法可以有效用于街景图像中的车辆和其它目标的检测和实例分割的案例展示:

*本工作由滴滴出行与中科院自动化所模式识别国家重点实验室多媒体计算团队合作完成
*本工作发表于国际顶级期刊IEEE Transactions on Image Processing:
Xingjia Pan, Fan Tang, Weiming Dong, Yang Gu, Zhichao Song, Yiping Meng, Pengfei Xu, Oilver Deussen, Changsheng Xu: Self-Supervised Feature Augmentation for Large Image Object Detection. IEEE Transactions on Image Processing 29: 6745-6758 (2020)
滴滴KDD2020论文解析系列
滴滴KDD2020论文(一) | 实时事件嵌入学习的动态异质图神经网络
滴滴KDD2020论文(二) | 一种新奇且通用的面向在线推荐的异构图信息融合框架
滴滴KDD2020论文(三) | 为客服构建更加智能的对话机器人
滴滴KDD2020论文(四) | 更精确地预估到达时间,新提出异质时空图卷积网络

