IDC 首份企业级通用 Agent 评估:中国电信 TeleAgent 进入前三
TeleAgent 的高分说明通用 Agent 的差距已不只在底层模型,更在模型外围的工程系统——上下文管理、模型路由与安全控制。
IDC 发布国内首份《中国企业级通用 Agent 产品技术评估》,不用传统大模型 Benchmark,改用近百道非公开任务,考察 Agent 能否在真实办公场景把事做完。中国电信 TeleAgent 常规任务 3.49 分、复杂任务 3.36 分,任务表现满分,成本效率为全场最高。
正文摘录
这便是 IDC 在最新发布的国内首份《中国企业级通用 Agent 产品技术评估》给出的结果: 并且这次 IDC 没有继续沿用大家熟悉的大模型 Benchmark,而是拿近百道非公开任务,直接考察一款 Agent 在真实办公环境里到底能不能把事情做完。 具体来看,TeleAgent 常规任务得分 3.49 分、复杂任务得分 3.36 分;九项能力中,任务表现拿到 5 分满分,成本效率为此次测评最高分。 而且 TeleAgent 正式上线的时间还不算久,今年 4 月,TeleAgent 桌面端还在公司内部试用。到 7 月,V1.0 才正式对外推出。短短一个多月,如今用户规模已经接近 120 万。 在深挖 TeleAgent 如何拿下第三名之前,我们还得先了解一下 IDC 这次到底考了什么。 以前我们熟知的 Benchmark,更多是倾向于把问题简化成一组分数;数学、代码、推理、知识,一项项跑完以后,就能大致判断模型能力处在哪个位置。 但要考验通用 Agent 的能力,评测的打法就不一样了;毕竟它面对的是公司内部纷繁复杂的业务。 按照 IDC 的定义,企业级通用 Agent 需要能够理解目标、调用工具和 Skill、连接企业知识和业务系统,并且持续执行任务。 围绕这个目标,IDC 设计了将近百道非公开任务,既包括邮件、日程、文档处理这类日常办公,也加入了长上下文、多步骤循环、复杂 PPT、表格处理和浏览器操作等复杂任务。 其中有些题目已经很接近真实工作,比如 Agent 要处理 3755 行脏数据,或者从约 3 万字材料中提炼内容,生成 11 页 PPT。 任务跑完还不算结束,IDC 还会继续核验系统状态和最终文件,确认 Agent 是否真的完成了任务。