清华团队开源 VeriLoop E2,用外部证据判定推理状态能否提交
VeriLoop E2 是一套让外部可验证证据决定推理中间结果能否保留的后训练框架,目的是让新增算力真正转化为可验证的进展,而不是模型自说自话。
大模型算得更多,不等于做得更对:一次代码修改可能修好主测试却弄坏回归测试,一步物理近似可能改善拟合却违反守恒。清华团队开源 VeriLoop E2,把「候选状态能否被持久保留」交给独立外部验证器裁定,面向代码、数学与物理任务完成后训练,并给出 9 项基准实测结果与 GGUF 量化版本。
正文摘录
.jpg)  自 2026 年夏季以来,前沿大模型进入新一轮高速演进期:参数规模持续扩大,上下文不断延伸,测试时计算进一步加深,工具调用能力也在迅速增强。 然而,当模型能够调用更多计算、进行更长推理之后,一个更基础的问题反而变得更加突出:算得更多,并不意味着做得更对?一次新的代码修改可能修复主测试,却同时破坏回归测试;一步数学推导可能减小局部误差,却使另一项约束失效;一个物理近似也可能改善拟合,却违反守恒关系。 显然,当前问题已由此从「模型还能不能继续算」,转向「新增计算能否被证明真正构成进展」。 针对这一结构性缺口,由 清华大学深圳国际研究生院刘厚德教授和周超男董事长 联合指导, 王立博博士后担任实验室团队 AI 研究员,李海启、向安麟两位人工智能方向硕士研究生作为 AI 研究助理 参与研发发布开源模型 VeriLoop E2。