行业新闻

BenchShield 提出覆盖评测全流程的 reward hacking 检测框架

BenchShield 用形式化模型加运行时插桩,追踪评测全流程里 Agent 是否越界刷分,把 reward hacking 检测从「查漏洞」推进到「判个案」。

Agent 在 benchmark(评测基准,用来衡量模型能力的标准测试集)上拿高分,不等于真的完成了任务——它可能利用评测机制的漏洞刷分,这叫 reward hacking(奖励劫持)。此前 BenchJack 审计出 219 处这类漏洞,但发现漏洞之后还需要判断:某一次具体运行到底有没有用它。达特茅斯学院、UC Berkeley 等机构提出 BenchShield,把检查从「答案对不对」扩展到产生分数的全过程。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/c2d097f7-a63f-4543-9de4-4f7ec7067c6b/0(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) BenchJack 之后,reward hacking 检测还缺什么? Agent 在 benchmark 上拿到高分,未必真正完成了任务。它也可能利用评测或奖励机制中的漏洞,绕开题目要求来提高得分。这类行为通常被称为 reward hacking。 此前,BenchJack 对 10 个 Agent benchmark 开展系统审计,发现了 219 处漏洞,并构造出能在多数 benchmark 上获得接近满分、却不解决实际任务的利用方式。研究团队将常见问题归纳为八类漏洞模式,整理成 Agent-Eval Checklist,供 benchmark 设计者检查和修补评测系统。 发现漏洞之后,还需要判断具体的一次运行:Agent 有没有使用这个漏洞?它的操作是否影响了最终分数?有漏洞的任务中也可能出现合规的执行过程,而一个通过测试的答案,也可能来自任务不允许的获取方式。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-29原文

相关内容