行业新闻

清华大学提出 Harness VLA,为机器人引入执行组织层

Harness VLA 证明,提升机器人能力不一定靠更大模型,组织调用方式同样关键。

清华大学团队提出 Harness VLA,首次在机器人系统中引入 Harness Layer(执行组织层)。底层 VLA 模型保持冻结,由 Agentic Planner 负责调度和失败恢复,在扰动测试中成功率从 50% 提升至 82.4%。

正文摘录

具身智能或进入 Token 时代,清华团队提出 Harness VLA 引领范式变迁 今天,清华大学于超教授团队联合正行创新、无问芯穹,正式发布并开源 Harness VLA。这一技术成果首次将数字智能中广泛应用的 Harness Layer 引入具身智能系统,在保持 VLA 模型冻结的基础上,通过 Agentic Planner 对模型调用、任务执行和失败恢复进行统一组织,让机器人从「依赖单一端到端模型」迈向「模型能力与系统能力协同工作」的新架构,显著提升机器人在复杂真实环境中的泛化能力。 在更具挑战性的 LIBERO-Pro 扰动评测中,Harness VLA 将成功率提升至 82.4%,显著超过 PiRLinf(50%)、NVIDIA Cap-X(18.2%)和 Berkeley RATS(43.8%),验证了「模型 + 系统」的新一代机器人智能架构的可行性。更重要的是,Harness 并非针对某一特定模型设计,而是一种面向系统层的通用框架。除了 VLA,它同样能够与 WAM 等具身基础模型结合,通过统一的任务执行层释放不同基础模型的能力,为未来具身智能系统提供更加通用的组织方式。 ![图片](https://mmbiz.qpic.cn/szmmbizjpg/5L8bhP5dIqFqbIKrVeYrONO7aOlQa9EIkIQrevZyNq524H34ibiaictv3IKQ2PicroREFdv5AiaibCtPzeQxUGj6wOfklgLIIiblQziaddeW4OjQWRI/640?wxfmt=jpeg&from=appmsgimgIndex=1) HarnessVLA 系统亮点介绍 过去两年,Vision-Language-Action(VLA,视觉-语言-动作)模型几乎已经把机器人操作的标准 Benchmark 的成功率做到了接近饱和。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-22原文

相关内容