行业新闻

研究:零训练 coding-agent 接机器人,具身导航成功率追平专用模型

通用 coding-agent 无需专门训练即可在具身导航中追平专用模型,且模型能力比框架更关键。

阿德莱德大学团队把 coding-agent(用于写代码的 AI 工具)直接接上机器人,不建图、不记忆、零训练,仅靠单目相机和四个动作,在视觉语言导航基准 R2R-CE 上达到 78% 成功率,追平甚至超过工业级专用模型,人类成绩为 94%。

正文摘录

具身导航大模型白训了?coding-agent 裸接机器人,成功率 78% 反超工业级专用模型 机器之心 ![](https://image.jiqizhixin.com/uploads/article/coverimage/a2441a94-7444-445f-9aa1-5fa31235d249/057.jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 不建图、不记忆、零训练:coding-agent 被直接扔进屋里,导航成绩反超工业级专用模型。 给它一只单目摄像头、四个动作按键,剩下什么都不给。 来自阿德莱德大学吴琦(Qi Wu)团队的一项新研究干了一件听起来有点大胆的事:把 coding-agent(就是 Claude Code、Codex 这些天天用来写代码的 AI 工具)原封不动地接上机器人,让它在陌生的房子里按语言指令导航。 不给地图,不给记忆模块,不给路径点预测器,不做任何导航训练,连一行领域代码都不写。 结果:在视觉语言导航(Visual Language Navigation, VLN)最经典的 R2R-CE 基准上,这个「裸奔」的通用 Agent 跑出了 78% 成功率,追平甚至超过了最近一批用大规模数据专门训练出来的工业级导航模型。 作为参照:人类在这个基准上的成绩是 94%。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-27原文

相关内容