联想天禧 TianxiCode 在 SWE-bench-Live 以 71% 解决率登顶
联想靠自研智能体框架加外部模型跑赢榜单,说明真实修 Bug 的能力更多取决于工程架构而非模型本身。
联想天禧 AI 自研的代码智能体框架 TianxiCode 搭配 DeepSeek-v4.1-Flash,在 SWE-bench-Live(以真实 GitHub 项目缺陷为题的软件工程评测)Lite 分榜上以 71% 的问题解决率排名第一,并通过官方 Verified 核验。
正文摘录
联想天禧 AI 自主研发的专业代码智能体框架 TianxiCode 以 71% 的问题解决率登顶全球第一名 近日,在国际公认难度最高、最贴近真实开发环境的软件工程评测 SWE-bench-Live(Lite 分榜)中,由联想天禧 AI 自主研发的专业代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash 取得突破性成绩:以 71% 的问题解决率登顶全球第一名,并正式通过官方审核。 这一成绩不仅标志着联想自研代码智能体框架迈入国际第一梯队,更展现出天禧 AI 生态以自研工程架构驱动模型潜能、在复杂软件工程竞技场抗衡全球顶尖方案的硬核实力。TianxiCode 是联想天禧 AI 聚焦代码生成、工程开发的代码智能子能力,未来将应用到联想 AI 硬件产品中。 不同于考查简单语法或单函数生成的传统代码测试,SWE-bench-Live 是当前全球软件工程领域的权威性动态评测基准。 SWE-bench-Live 以真实 GitHub 项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境。相较于单纯考查代码片段生成,这类评测更贴近真实开发中的问题处理过程,对系统理解代码、定位问题和完成修复提出了综合要求。 为了确保评测的绝对公正,SWE-bench-Live 官方设立了“Verified”核验机制。参评方案必须提交全链路的智能体运行轨迹(Trajectories),由官方团队严格审查评测输入、信息隔离环境,并彻底排查是否存在向智能体泄露标准答案、测试用例或结果的可能。TianxiCode 与 DeepSeek-v4.1-Flash 成功通过审查并斩获“Verified”认证,充分证明了其代码修复成绩的可复现性与高含金量。