RiO-DETR突破实时旋转目标检测难题:中科大联合华为清华实现2.7ms端到端推理
在现代计算机视觉领域,旋转目标检测技术面临着前所未有的挑战。传统的水平边界框检测方法虽然能够完整包围目标,但在处理遥感影像、交通感知、场景文字识别等复杂任务时,往往会纳入大量无关背景信息,严重影响检测精度。旋转框检测技术虽然能够更精确地贴合目标轮廓,但新增的角度维度显著提升了检测器的训练难度和参数调节复杂度,特别是在终端设备上实现实时推理更是面临巨大挑战。

以往的旋转目标检测方案主要依赖CNN架构来追求速度优势。DETR框架虽然具备端到端的优势,能够省去NMS后处理步骤,但一旦从水平框扩展到旋转检测,繁重的注意力运算、角度周期性歧义问题以及更为复杂的匹配搜索空间,往往会导致实时推理能力的丧失。这种技术瓶颈一直困扰着研究人员,直到RiO-DETR的出现。
中国科学技术大学联合华为、清华大学等顶尖机构提出的RiO-DETR,首次将端到端旋转检测推向真正的实时区间。在DOTA-1.0单尺度设置下,最轻量的RiO-DETR-n仅有4.0M参数,端到端延迟低至2.7ms,AP50却能达到78.4;而最强的RiO-DETR-x在29.9ms下跑出81.8 AP50的卓越成绩。该研究成果已被ECCV 2026接收为Oral(Spotlight),标志着旋转目标检测技术的重要突破。

从技术发展的角度来看,RiO-DETR并非简单地给RT-DETR增加角度回归头。研究团队重新审视了一个根本性问题:角度究竟应该被当作普通坐标,还是被视为由视觉内容决定、且生活在周期空间里的变量。这个看似简单的哲学思考,实际上触及了旋转目标检测的核心本质。

标准DETR通常通过中心点坐标、宽、高来表征边界框,再由解码器逐层迭代优化预测结果。表面上看,只需额外增加一个角度预测参数,就能将水平框方案扩展为旋转框检测。但现有研究表明,这一改动本质上对应着完全不同的优化问题。水平目标检测中,中心坐标与宽高参数定义在连续欧氏空间,参数更新方向清晰直观。旋转框却面临多重技术难点:角度具备周期性,同一个矩形还能通过互换宽高产生多组等价参数表达;特别是在周期临界点附近,两组数值差异巨大的角度,对应的几何框却几乎完全重合。

目标朝向无法单纯依靠框体位置与尺寸推断。飞机机头朝向、舰船航向、车辆行进方向,都需要依托目标纹理、部件结构乃至语义上下文综合判断。如果模型将角度视为和中心坐标、宽高同类的位置参数,训练初期不准确的角度预测,极易干扰注意力模块的采样区域,造成训练偏差。

过去许多基于DETR改造的旋转检测方法,为了提升精度堆叠了复杂度较高的注意力机制与特征采样模块,推理速度始终难以追上YOLO、RTMDet等CNN实时检测器。RiO-DETR选择了另一条技术路径:首先基于RT-DETRv2构建高性能旋转检测基线,引入D-FINE的通用匹配策略与DEIM的Dense O2O训练范式,随后围绕旋转检测独有的三大底层痛点,对网络结构开展系统性针对性优化。

第一个挑战是语义与几何耦合问题。位置和尺寸主要由几何关系决定,角度却常常需要结合纹理方向、物体朝向和部件布局判断。把角度硬塞进位置查询,可能在训练早期引入噪声。第二个挑战是角度的周期性特性。在周期空间里,接近0度和接近180度的两个方向,几何上可能非常接近,数值上却相距很远。普通加法更新和L1损失会在周期边界处给出错误的优化方向。第三个挑战是搜索空间扩大。旋转框增加了自由度,二分图匹配与角度预测收敛更慢;水平检测里常见的密集监督,也未必能提供足够的角度多样性。
RiO-DETR的三项核心设计,正好逐一对应这三个问题。总体架构包括内容驱动角度估计、旋转校正正交注意力与解耦周期细化,形成了完整的技术解决方案。

内容驱动角度估计机制是RiO-DETR的核心创新之一。现有多数旋转DETR方案,会将中心点、宽高与角度共五个参数一并编码至位置查询。该方式暗含一个前提假设:这几组参数属于同一类几何信息。但角度具备显著特殊性——中心坐标与框尺寸回答的是