自验证框架助开源模型超越 Fable 5,成本降低 11 倍
开源模型通过“多次采样→自我验证→选最优”的方式,以极低成本超越闭源模型,展示了推理时扩展的潜力。
斯坦福团队最新实验发现,用 DeepSeek V4 Flash 生成 5 条候选结果后,让同一个模型验证、打分和排序,即可在 Terminal-Bench 2.1 上超越 Claude Fable 5,成功率从 79% 提升至 88%。由于开源模型 Token 成本低,即使加上额外采样和验证,整体成本仍比闭源模型低约 11 倍,且候选可并行生成,延迟不会按比例增长。
正文摘录
.jpg)  随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「 自验证 」,可以在 Terminal-Bench 2.1 上 超越 Claude Fable 5 ,同时整体 成本低约 11 倍 。  - GitHub 代码:https://github.com/llm-as-a-verifier/llm-as-a-verifier 具体来说,团队首先让 DeepSeek V4 Flash 针对同一个任务生成 5 条候选 Agent 轨迹。