行业新闻

自验证框架助开源模型超越 Fable 5,成本降低 11 倍

开源模型通过“多次采样→自我验证→选最优”的方式,以极低成本超越闭源模型,展示了推理时扩展的潜力。

斯坦福团队最新实验发现,用 DeepSeek V4 Flash 生成 5 条候选结果后,让同一个模型验证、打分和排序,即可在 Terminal-Bench 2.1 上超越 Claude Fable 5,成功率从 79% 提升至 88%。由于开源模型 Token 成本低,即使加上额外采样和验证,整体成本仍比闭源模型低约 11 倍,且候选可并行生成,延迟不会按比例增长。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/b78b32bb-19b7-4ff8-b6b2-3be85d4a7592/048(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「 自验证 」,可以在 Terminal-Bench 2.1 上 超越 Claude Fable 5 ,同时整体 成本低约 11 倍 。 ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqEEgKEdmhTiaCjN3olicIwO8Lfiaf7EwDI6xWfeEICTNh6MseaVJicloowwwR9WFUgqiaoKJ1Fc8QIpqQrEKqCXtjD0JfrhcfUokXUE/640?wxfmt=png&from=appmsgimgIndex=1) - GitHub 代码:https://github.com/llm-as-a-verifier/llm-as-a-verifier 具体来说,团队首先让 DeepSeek V4 Flash 针对同一个任务生成 5 条候选 Agent 轨迹。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-27原文

相关内容