行业新闻

银河通用评测:GPT-6 Astra 混合架构将机器人任务成功率提至 48%

大模型能看懂任务、发现哪里不对,但精细操作仍得靠专用 VLA 模型;两者互补比单用任何一个都强。

银河通用团队发布闭环控制对比测评:让 GPT-6 Astra(通用大模型)负责语义判断与纠错,VLA 模型 π0.5(视觉-语言-动作模型,把画面和指令直接转成机器人动作)负责物理操作。两者混合后任务成功率从 26% 升到 48%,而 Astra 只改动了 14.4% 的控制步骤。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/6a937ace-6829-49eb-aaf5-c771045a6644/039(2).jpg) 近日,一份匿名发表在 GitHub 上的仿真测评报告,在具身智能圈投下了一枚深水炸弹:搭载混合 GPT-6 Astra 的架构拿下 62.6 分,第二名仅 38.26 分。 64% 的性能差距,已经不是微调优化能解释的了,可以说是架构层面的降维打击。 这项研究没有用 GPT-6 Astra 直接操控机械臂,它做了一件更聪明的事:用 GPT-6 Astra 提供语义层面的判断与修正,与 π₀.₅ 的物理空间交互及动作先验形成互补架构。 银河通用团队对 Astra 模型的深度评测,揭示了其在 System 2 通用性上的重要突破。虽然轨迹质量和实时性不高,但它可以零样本地在各种形态机器人上高成功率完成各类新任务,并有很强的错误恢复能力。 看起来,具身智能离我们已不再遥远。在数万亿级的模型参数体量下,机器人的通用性已经取得了类似 ChatGPT 那一次的水平飞跃。 这份测评是怎么做的? 该报告的作者来自银河通用团队,第一作者是银河通用创始人兼 CTO 王鹤教授的博士生。整个测评是一套严格对齐的闭环控制对比实验。 研究分析了两种用于仿真双臂操作的闭环控制架构: Direct 模式:不跑 π0.5,GPT-6 Astra 直接看三路相机画面和机器人状态,输出双臂末端位姿和夹爪开合,每次执行 1 到 5 个控制步。 混合模式:每个决策时刻,π0.5 先生成 50 步候选动作。GPT-6 Astra 看同一份画面、执行历史,以及候选动作对应的双臂轨迹,然后二选一:要么沿用 π0.5 的前 1 到 15 步,要么自己出 1 到 5 步末端位姿修正。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-16原文

相关内容