Ultralytics YOLO26:统一实时端到端视觉模型
实时视觉模型需要在多种硬件上实现准确、高效且易部署。YOLO 系列广泛应用,但多数 YOLO 检测器仍依赖推理时的非极大值抑制(NMS),因 Distribution Focal Loss(DFL) 导致检测头过重,需要长训练周期,且可能遗漏最小物体的正标签分配。我们提出 Ultralytics YOLO26,一个统一的实时视觉模型族,通过协调的架构与训练改进解决上述局限。 YOLO26 采用双头设计实现原生无 NMS 端到端推理,并彻底移除 DFL,得到更轻量且回归范围无约束的检测头。其训练 pipeline 结合了从大语言模型训练中改编的混合优化器 MuSGD(Muon‑SGD)、逐步将监督信号转向推理时头的 Progressive Loss,以及保证小物体正覆盖的标签分配策略 STAL。 除检测外,YOLO26 为实例分割、姿态估计和旋转目标检测引入了任务特定的头与损失设计,在各类任务和尺度上取得一致提升。模型族涵盖五个尺度(n/s/m/l/x),支持检测、实例分割、姿态估计、分类及旋转目标检测于同一 pipeline,并配有开放词汇扩展 YOLOE-26,实现文本、视觉和提示自由的推理。 所有尺度上,YOLO26 在 COCO 上达到 40.9‑57.5 mAP,T4 TensorRT 延迟 1.7‑11.8 ms,相较于先前实时检测器推进了精度‑延迟帕累托前沿;而 YOLOE-26x 在文本提示下于 LVIS minival 上达到 40.6 AP。代码与模型已开源。
论文精读
TL;DR YOLO26 是一族统一实时视觉模型,通过 NMS-free 双头设计、移除 DFL、Muon-SGD 优化器与渐进损失,同时支持检测、分割、姿态估计等任务,在 COCO 上显著推进精度-延迟前沿。
问题
问题背景
实时视觉模型需要在精度、推理延迟与部署便捷性之间取得平衡,当前 YOLO 系列已成为工业界部署最广泛的检测器之一。
现有方法的局限
尽管 YOLO 系列不断演进,主流变体仍存在四个关键技术瓶颈:
- 对 NMS 的强依赖:大多数 YOLO 检测器在推理时仍需 非极大值抑制 (NMS) 后处理,这不仅引入超参数敏感性与动态延迟,还阻碍了端到端的全流水线部署。
- 检测头冗余与 DFL 负担:为缓解回归边界模糊,许多模型引入了 Distribution Focal Loss (DFL),导致检测头参数膨胀、回归范围受限,并增加训练显存消耗。
- 训练周期漫长:现有方法通常需要数百甚至上千个 epoch 的训练才能收敛,大幅拖慢了实验迭代与落地速度。
- 小目标正样本分配缺失:基于中心点的标签分配策略在微小物体上极易失败,造成极小目标完全没有正样本,直接限制了对小目标的召回能力。
问题的难点与重要性
工业级部署对延迟极其敏感:毫秒级的波动可能影响自动驾驶、机器人抓取等系统的实时决策。同时,多任务统一(检测、分割、姿态、旋转框)需求日益强烈,若每个任务独立维护一套架构,工程成本极高。上述四点问题相互耦合:去除 NMS 要求模型具备端到端的唯一匹配能力,但仅靠一对一匹配又容易丢失特征信号;删除 DFL 需要新的回归损失与训练策略;加速收敛需借助大模型训练中的优化器技术;小目标正样本保障则必须重新设计标签分配逻辑。这些挑战使得构建一套统一的、NMS-free、轻量、易训且高精度的实时模型变得极其困难,也正因如此,业界对该类方案的需求愈发迫切。
类比:就像一个工业质检产线需要同时完成缺陷检测、尺寸测量与方向判断,但相机处理能力有限,必须在一个模型内高效完成所有这些任务,任何过重的后处理或训练成本都会拖慢整条产线的吞吐。
核心洞察
- - 端到端 NMS-free 检测无需 DFL 化简部署: YOLO26 采用一对一头直接输出唯一预测, 完全移除 Distribution Focal Loss, 回归头更轻量且范围不受限, 避免 NMS 后处理。与 YOLOX 的 SimOTA 和 YOLOv10 的双标签策略不同, YOLO26 从架构上消除冗余, 训练-推理一致, 在简化管线同时保持精度, 对需要跨硬件快速部署的场景尤其有价值。
- - 借鉴 LLM 训练的 MuSGD 优化器加速视觉模型收敛: YOLO26 引入混合优化器 MuSGD, 将 Muon (常用于大语言模型) 的高效权重更新与 SGD 的稳定性结合, 应用于检测任务。相比常规 AdamW 或 SGD, MuSGD 显著缩短训练时间且提升模型精度。这种跨领域优化迁移无额外推理开销, 为视觉模型训练效率提升提供新范式, 尤其利于资源受限研发环境。
方法
输入与 backbone
YOLO26 以单张图像作为输入,经骨干网络(如 CSPDarkNet 结构)提取多尺度特征。颈网络沿用 PAN‑like 路径聚合,融合不同层级的语义和空间信息,输出一组强化特征图给后续检测头。
关键模块:双头设计与 DFL 移除
- 双头设计:检测端包含两个并行头——一对多头(one‑to‑many)和一对一(one‑to‑one)头。训练时 one‑to‑many 头提供密集监督信号,学习丰富的表征;推理时仅激活 one‑to‑one 头,每个网格点直接预测唯一目标,无需 NMS,实现端到端目标检测。
- DFL 移除:彻底去除分布焦点损失(DFL),回归支路直接输出边界框坐标,不再预测离散分布。这大幅降低检测头的参数量和计算量,同时消除了回归范围的先验约束,让模型更灵活适应不同尺度和长宽比的目标。
训练策略创新
- MuSGD 优化器:借鉴大语言模型训练的 Muon‑SGD 混合优化器,将 Muon 的动量更新机制融入 SGD,加速收敛并提升最终精度,尤其适配 YOLO 这类卷积网络。
- 渐进损失(Progressive Loss):训练过程中逐步将损失权重从 one‑to‑many 头转移至 one‑to‑one 头,使得两个头协同优化并最终对齐推理行为,避免训练–推理不一致。
- 小目标感知标签分配(STAL):针对小目标常被忽略的标签分配难题,STAL 强制为小目标保证正样本覆盖,缓解小目标漏检问题。
输出
各尺度特征图直接输出类别分数和边界框参数,无需后处理;与分类、分割等多任务统一在单个管线中。
与同类方法的差异:相比 DETR 系列依赖 transformer decoder 和二分匹配实现 NMS‑free,YOLO26 以轻量的卷积双头 + 专用训练策略实现更低延迟的端到端检测,且完全摒弃 DFL,在实时性上更具优势。
实验
实验设计围绕消除 NMS、精简检测头、优化训练策略展开,通过组件消融和全任务标杆对比,验证 YOLO26 族群在速度–精度曲线上的领先性。
实验设计
检测主实验在 COCO 上进行,覆盖 n/s/m/l/x 五个规模,统一使用 Objects365 预训练加 COCO 微调管线;消融实验依次检验 DFL 移除、MuSGD 优化器、Progressive Loss 和 STAL 标签分配 的增益。任务扩展在实例分割(COCO)、姿态估计(CrowdPose)、定向检测(DOTA)上评测,开放词汇分支 YOLOE-26 则在 LVIS 上验证文本引导与 prompt-free 推理。
关键发现
- NMS-free 端到端:双头设计配合 Progressive Loss 可无缝切换一对多训练与一对一推理,彻底省去后处理,且精度无退化;
- DFL 移除:去除 Distribution Focal Loss 后回归头更轻量,配合 MuSGD 优化器收敛更快,训练时长缩短;
- 小目标覆盖:STAL 策略保证所有尺寸的目标均有正样本分配,缓解漏检;
- 跨任务一致性:统一的检测头与损失设计在分割、姿态、旋转框任务上均带来显著提升。
与基线对比的深度解读
相比依赖 NMS 的 YOLO 前代及同级实时检测器(如 YOLOv9/10、RT-DETR),YOLO26 在相同的 TensorRT 延迟下取得更高 mAP,尤其在中高精度区域将帕累托前沿向前推进。关键差异化在于训练–推理一致的对齐:MuSGD 借鉴 LLM 训练经验,Progressive Loss 逐步从富监督的一对多头过渡到推理时的一对一头,使得模型直接从端到端学习精准定位,而非事后过滤。YOLOE-26 进一步将开放词汇能力引入实时框架,文本提示下 40.6 AP 表明部署级多模态检测已属可行。但计算资源未详述,大规模复现需关注 Objects365 预训练成本。
行业影响
落地场景
YOLO26 以 ms 级延迟在 COCO 上达到 40.9-57.5 mAP,且原生支持 NMS-free 端到端推理,非常适合需要实时性的视频理解场景。多任务统一架构(检测、分割、姿态估计、定向检测、开放词汇)可在以下产品中落地:
- 自动驾驶感知:单模型同时输出目标边框、实例分割和行人姿态,简化车载计算图,并通过 NMS-free 消除后处理抖动,提升控制稳定性。
- 安防与工业视觉:高速生产线缺陷检测、仓库货物跟踪,可受益于小目标感知策略 STAL 和不依赖 DFL 的轻量检测头。
- 视频内容审核与增强现实:开放词汇版本 YOLOE-26 支持文本或视觉提示,实现零样本过滤违规内容,或为 AR 设备提供交互式物体识别。
商业价值
- 降本:去除 Distribution Focal Loss (DFL) 和 NMS 后,模型头更轻量,推理内存和算力需求降低;配合 MuSGD 优化器缩短训练周期,直接减少 GPU 租赁或私有化部署成本。
- 增收:多任务统一模型替代以往多个独立模型,降低维护和迭代开销;对电商平台、内容平台而言,更快更准的视觉搜索与推荐能提升转化率。
- 体验提升:NMS-free 推理杜绝了漏检和框抖动,在自动驾驶、机器人导航中显著提升安全性和流畅度;小目标覆盖优化(STAL)使远程物体识别更可靠,扩大可用场景。
与现有产品 / 工作流的接口
YOLO26 通过 Ultralytics 生态提供 TensorRT、ONNX 等工业标准导出,可直接嵌入现有 C++ / Python 推理服务。对于已使用 YOLO 系列的企业,升级路径平缓:模型配置和训练 recipe 与现有 YOLOv5/v8 兼容。多任务分支设计允许单独加载检测、分割或姿态头,无需修改主干网络,可按需部署到端侧或边缘节点。开放词汇分支 YOLOE-26 可作为独立组件与闭集模型组成级联系统,在文本检索或 visual prompt 下灵活扩展类别,不破坏原有流水线。
具体落地用例
- 全球电商平台的商品图片搜索:用户上传图片,系统需实时检测商品并提取分类、分割 mask 和关键点。YOLO26 端到端 NMS-free 检测提供毫秒级响应,分割分支生成精确边缘用于抠图换背景,姿态估计可用于鞋服类目的虚拟试穿。仅需一次前向传播,降低延迟和服务器成本。
- 自动驾驶的多任务感知:前视摄像头输入后,YOLO26 同时输出车辆、行人的 2D 边框、实例分割以及行人姿势,且 OBB 头可检测旋转的车位或路标。NMS-free 特性确保每帧输出一致性的目标 ID 分配,为规划模块提供更稳定的目标轨迹,减少后处理时延抖动。
局限
- - **依赖大规模预训练数据**:YOLO26 的训练流程中使用了 Objects365-v1 预训练,这虽然提升了精度,但增加了数据获取和计算开销,对于资源受限的研究者或特定领域(如医疗、遥感)可能难以复现或迁移,限制了该框架的通用性。
- - **端到端检测在极端密集场景下的召回隐忧**:移除 NMS 依赖 one-to-one 二阶段头,每个位置仅绑定一个正样本,虽简化了后处理,但可能在高度重叠的小目标场景(如人群、交通拥堵)中出现漏检,论文未给出该场景的专项消融分析,实际部署时需谨慎评估。
- - **多任务统一模型的潜在干扰**:YOLO26 同时支持检测、分割、姿态、旋转框等任务,共享骨干网络可能引发任务间负迁移,且训练超参(如 Progressive Loss 的权重分配)在不同任务组合下需要精细调整,论文未讨论多任务联合训练时的稳定性与最优配置策略。