行业新闻

人大高瓴149页综述系统梳理长程智能体

长程智能体能力源于外部脚手架工程与内部模型优化的协同演进,而非单纯扩大模型规模。

大模型已从聊天机器人演变为决策核心,但长程任务中智能体容易因单步错误积累而失控。该综述提出外部脚手架工程与内部模型优化协同演进的视角,定义了H1-H3任务层级和C1-C3能力层级,并指出长程能力是系统级属性,而非单纯模型指标。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/3720abe4-726f-4e63-8aad-b347285f6291/043(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 过去几年,大模型已经从单轮聊天机器人,快速演变为软件工程、深度检索、计算机操作、多模态交互与科学发现中的决策核心。新的问题随之出现: 一个智能体即使单步表现足够聪明,能否在数百、数千次相互依赖的行动中始终记得目标、修正错误、管理上下文,并可靠安全地把任 务 做完? 这正是 长程智能体(Long-Horizon Agents) 研究要回答的问题。在智能体能力快速演进的今天,长程能力正日益成为其进入真实生产环境的核心瓶颈。依据 METR 的测量:在约 50% 成功率下,前沿智能体完成软件工程类任务的 “人类专家等效时长” 已从早期模型的秒级提升到十余小时。如图 1 所示, 该时间跨度大约每 7 个月翻一倍;从 2023 年后,翻倍周期进一步缩短至约 4 个月 ,这说明智能体的长程能力仍处在高速扩展阶段。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-25原文

相关内容