行业新闻

微软 EChoverse 用高保真进化环境训练计算机代理,9B 模型性能逼近 GPT-5.4

微软 EChoverse 用高保真进化环境训练计算机代理,9B 模型性能逼近 GPT-5.4

Echoverse 通过高保真、可进化的训练环境,使小型语言模型在计算机操作任务上性能大幅提升,逼近大模型,证明深度模拟数据比单纯增加数据量更有效。

微软推出十二个深度模拟的训练世界(Echoverse),专为计算机操作代理设计。这些环境复现真实应用行为、保持状态连贯,让代理学到操作结果。9B 模型训练后得分从 36.5% 跃升至 67.1%,接近 GPT-5.4。研究强调模拟真实度比数量更重要。

正文摘录

Echoverse:为计算机使用代理打造的深层、进化式环境 在数量之上追求保真度,瞄准代理真正缺乏的能力,并与训练的模型共同进化 ![迭代训练循环示意图:模型生成世界,世界产生带评分的运行,反馈同时更新世界和模型。](https://www.microsoft.com/en-us/research/wp-content/uploads/2026/07/PraxisWorld-BlogHeroFeature-1400x788-1.jpg) 概览 我们为计算机使用代理构建了十二个训练世界:十个深度领域世界和两个能力世界,每个世界针对一种以多种形式呈现的 UI 控件(如日期选择器和嵌套过滤器)进行专项训练。深度 才是让它们值得训练的原因:这些世界复制了应用的真实行为,植入了真实数据,并跨屏幕和用户保持状态一致。在全部十二个世界训练后,一个 9B 模型几乎将基础分数翻倍(从 36.5% 提升至 67.1%),距离 GPT-5.4 仅差十四个百分点。实验给了我们几个教训: - 高仿真度是必须的;浅层世界会伤害代理。在同一站点的浅层和深层版本上训练后,模型在浅层版本上退步,但在深层版本上进步。 - 代理常常在同样的挑战性 UI 元素上挣扎,比如日期选择器和嵌套过滤器。以多种形式专项训练这些控件,使模型学会了如何操作它在训练中从未见过的领域中的同类控件。 - 共同进化模型、世界和验证器能提升三者。随着世界变得更正确、任务变得更难,模型也随之攀登。 - 针对世界的强化学习推动代理超越模仿。使用基于真实数据的验证器作为奖励,RL 提升了保留任务的性能,并教会代理用更少的步骤达成目标。 - 我们正在发布四个世界及其代码、数据和基于真实数据的评分器,以支持高保真计算机使用世界的研究。

阅读原文(microsoft.com)→

行业新闻Akshay Nambi, Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Yash Lara, Ahmed Awadallah, Ece Kamar2026-07-30原文

相关内容