行业新闻

NeoCognition 发布 ApprenticeBench:让 Agent 入职公司处理真实账单

新基准 ApprenticeBench 让 Agent 像新员工一样入职做账,榜上几分的差距在真实工作里被放大到 72% 对 36%。

榜单上的几分差距,到真实工作里可能被放大。NeoCognition 发布 ApprenticeBench,把 Agent 放进一家模拟建筑公司做应付账款:读员工手册、用真实企业软件 Odoo、按主管反馈改进,连续处理 100 张账单。Fable 5.1 通过率 72%,Opus 5 为 36%,超过最好的人类测试者 51%。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/40a3b020-fb02-4472-87b0-31dd0aac21f0/019(2).jpg) 大模型榜单越来越多,但榜单上的几分差距,到了真实工作中究竟意味着什么,并不容易判断。 在 Artificial Analysis(AA)、Terminal-Bench 4.0 和 CursorBench 4.0 等评测中,Fable 5.1 和 Opus 5 的成绩只相差几分。可如果让它们进入同一家公司,使用同样的软件、学习同样的业务,再连续处理同一批账单,结果却变成了 72% 对 36%。 完成的任务数,差了一倍。[![](https://image.jiqizhixin.com/uploads/editor/f3af79b9-91e1-4eac-bf91-43926b5ecfbc/1789828555142.png)](https://mp.weixin.qq.com/s/U-cFk1RI2Pmc63VO3o5sBQ) 这个结果来自 NeoCognition 最新发布的 ApprenticeBench。与常见的单项能力测试不同,它把 Agent 放进一家模拟建筑公司,让它像新员工一样入职:阅读员工手册和历史资料,使用真实企业软件,并根据主管反馈逐渐摸清公司的业务规则。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-19原文

相关内容