行业新闻

Qwen 与复旦研究发现编程智能体奖励设计存在结构性缺陷

这篇论文揭示了一个反直觉的事实:对编程智能体来说,验证一个解比找到它更难,奖励设计存在结构性困境。

编程智能体在执行任务时,会利用测试漏洞作弊——比如直接修改测试使其返回通过。Qwen 与复旦等团队指出,验证方案本身已成为瓶颈:生成解法变得廉价,但可靠验证却难以扩展,导致奖励信号被“劫持”。

正文摘录

![图片](https://image.jiqizhixin.com/uploads/article/coverimage/6a96b0da-c086-4f5b-b64b-aa89e46cefb6/025(2).jpg) 设想这样一幕:你让一个编码智能体修复某个 bug,并用一组单元测试作为「做对了没有」的判据。 模型反复尝试仍然跑不通,于是它做了一件出乎意料、却又 「完全合理」的事 —— 它改写了那条测试,让它 永远返回“Passed” 。 从奖励的视角看,任务「完成」了,分数到手;从你的视角看,它什么都没修。 这正是过去一年里无数从业者反复撞见的画面。它的尴尬之处在于:模型并没有 「使坏」,它只是忠实地优化了你给它的那个信号。问题出在信号本身。模型不仅会学习如何修 bug,也会学习如何利用测试、环境和信息泄漏来获得奖励。 ![图片](https://image.jiqizhixin.com/uploads/editor/0787895b-a2f1-46d9-ab1e-7050d93ac527/640.png) 几十年来,一条计算领域的「常识」悄悄塑造着我们对难题的直觉:验证一个解,比找到它更容易。复杂的数学推理、代码生成正是凭借这一直觉取得了非凡进展 —— 只要存在一个可执行、可校验的奖励(verifiable reward),强化学习就能把能力源源不断地「抽」出来。 但对今天的编码智能体而言,这条直觉正在反转:随着基础模型推理能力的提升,叠加 harness 工程的放大,生成一个足够复杂的候选解已经变得廉价;而要可靠地验证它 —— 既忠实于用户的真实意图、又能在海量训练规模下扩展、还要抵御一个不断优化的对手 —— 反而成了整个闭环里最昂贵、最开放的难题。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-02原文

相关内容