行业新闻

AI21 Labs 研究:编码智能体基准测试中“金像”答案掩盖功能失败

AI21 Labs 研究:编码智能体基准测试中“金像”答案掩盖功能失败

这篇博客指出编码智能体基准测试的缺陷——模型的表面完美答案掩盖了功能失败,警示评估方法需要改进。

AI21 Labs 最新研究揭示,当前编码智能体基准测试存在盲点:模型能生成看似完美(gold-like)的答案,但在实际功能执行上却失败。这提醒业界,基准测试可能高估了模型能力,需要更注重功能验证而非答案表面相似性。

正文摘录

闪光的不都是金子:当“金样”答案掩盖了编码智能体基准测试的功能缺陷 - 标题: All that glitters: When "gold-like" answers mask functional failures on coding agent benchmarks - 来源公司: AI21 Labs - 正文: TL;DR 在对我们的编码智能体进行基准测试时,我们注意到 LLM Judge —— Maestro 中从并行智能体运行中选出最佳输出的组件 —— 表现得异常好。数据污染是明显的嫌疑对象 —— 但当我们在模型不可能见过的干净数据集上复现了同样的偏差时,我们意识到另有隐情:Judge 学会了偏爱那些看起来像金答案的解决方案 —— 精简、干净、专注 —— 而不是真正能工作的输出。在这篇博客中,我们隔离并量化了这种“金样”偏好对基准数据的影响,并提出了一种减轻其影响的策略,以保持编码基准测试结果的完整性。 一个新的数据失真元凶 当 LLM 在公开基准测试上表现异常出色时,数据污染通常是元凶。所以当我们注意到我们的 reducer(一种 LLM Judge,从并行智能体运行中选出最佳补丁)在 SWE-bench Verified 上明显偏好金答案时,我们自然怀疑模型记住了数据集。两个月后,[OpenAI 宣布](https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/)他们得出了同样的结论,这进一步证实了我们的疑虑:太多的前沿模型已经熟悉了 SWE-bench Verified 数据集。SWE-bench 被宣布受到污染。 回到实验室,我们在 [SWE-rebench](https://swe-rebench.com/)(一个较新、抗污染的数据集)上复现了实验;

阅读原文(ai21.com)→

行业新闻2026-04-14原文

相关内容