行业新闻

杰富瑞实测八款AI Agent 千问办公综合评分居首

这则消息说明,Agent竞争已不仅是模型能力,工程协同与单任务成本正成为企业选型的关键。

华尔街投行杰富瑞对8款主流AI Agent(能自主规划并完成多步任务的智能体)做了真实办公测试。阿里千问办公综合得分第一,且是唯一所有维度均超90分的产品。它的优势在于模型与Harness(围绕模型的工程机制,含指令、工具调用、纠错等)的协同更好,API成本也更低。

正文摘录

8月19日消息,华尔街投行杰富瑞分析师近日对八款全球主流AI Agent进行了真实办公任务实测,结果显示,通过模型和Harness的协同,阿里千问办公综合得分排名第一,超过美国的Claude Cowork和Codex等Agent工具。 On August 19, analysts at Wall Street investment bank Jefferies conducted real-world office task testing on eight mainstream global AI agents. The results showed that, through the synergy of models and harness, Alibaba's Qwen Office ranked first overall, surpassing US-based agent tools such as Claude Cowork and Codex. 此次测试共设置5项真实办公任务,包括基于多份文件完成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT,以及基于参考图片生成营销海报。测试结果显示,千问办公整体表现较为均衡,尤其在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中表现突出,是唯一一个在所有测评维度中均获得90分以上的Agent产品。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-08-20原文

相关内容