A Frozen 12B 在验证任务上击败 Frontier Models:100% 准确率,0 Tokens,比特精确,永久有效
当前语言模型改进依赖重训练,计算量巨大、模型不透明且输出非确定性。本文提出相反路径:模型冻结,同时构建持续增长的已验证解决方案记忆库。一旦某问题族被解决并经过独立验证(不参考答案),该族所有新实例均以零生成 token、比特精确、确定性回答。 在涵盖 9 个问题族的 180 个全新实例上,来自 4 家供应商的 4 种架构(密集和 MoE)均实现 180/180 准确率,零 token 生成:执行能力与参数规模解耦。负对照实验将能力完全归因于记忆库——清空后无法解决任何问题。该存储-验证契约同样适用于开放推理:4 个模型均获得 88/88 一致性门控接受,机器验证形式化证明,推理方法迁移达 77/80。 记忆选择仅需 1.4 微秒,完整复用耗时 6-23 ms,功耗 36 mWh。在包含 4,500 项的验证库上,近似相似检索错误率达 94.3%,而精确地址匹配零错误。该记忆库还可作为工作上下文,其规模远超现有引擎:单块 46 GB GPU 上可移动 6,000,000 token 窗口,而 vLLM 上限为 30,399 token,SGLang 在 32,000 token 后静默截断。 在公开基准上,前沿模型从头推理仍远优于任何 12B 模型;但在本系统已解决并验证的任务上,对比反转:前沿 API 每次查询均需全新生成,而验证复用成本为零 token 且每次返回相同比特。配套公开测试台:https://corbenic-galahad-bench.hf.space
论文精读
TL;DR 冻结 12B 模型外挂已验证解的记忆库,对已掌握的问题族实现零 token、比特精确的确定性回答,在验证任务上以 100% 准确率击败前沿模型,将推理能力与参数规模解耦。
问题
问题背景
当前大语言模型(LLM)在推理时普遍采用每一次查询都从头生成的范式——模型参数固定或不断更新,但每次收到已知问题或问题族的变体时,仍需执行完整的生成过程,无法直接复用已验证的答案。这导致计算资源浪费、延迟高、输出不确定性,并且模型能力的提升高度依赖参数规模与重复训练。
现有方法的局限
主流做法是通过参数更新(微调、RLHF、持续预训练)来增强模型在特定问题上的表现,或采用检索增强生成(RAG)从外部知识库获取信息后再生成。这些方法存在以下技术局限:
- 生成成本不可消除:即使面对完全重复或等价的问题,仍要消耗 token 生成预算,每次调用都产生推理开销。
- 输出非确定性:温度采样、模型随机性导致同一输入可能得到不同答案,无法保证 100% 精确重复,对要求严格一致性的场景(如数学证明、代码生成)构成风险。
- 知识复用低效:验证过的正确解不能被压缩为可比特级精确复用的记忆,检索相似度匹配可能引入错误(本文实验表明近似检索选择错误项的比例高达 94.3%)。
难点与重要性
核心挑战在于:如何在不修改模型参数的前提下,构建一个与模型分离但能精确匹配问题族的持久化验证记忆,并保证每次命中时直接返回比特一致的答案,同时避免污染模型原有推理能力。 该问题重要性体现在:
- 经济性:前沿模型 API 调用成本高昂,若能对已验证问题族实现“零 token 生成”,将大幅降低推理开销,直接改变成本结构。
- 可靠性:验证过的解一旦存入记忆,后续复用可达到 100% 准确率和确定性,对安全关键型应用至关重要。
- 解耦扩展:能力增长不再依赖模型参数膨胀,而是通过积累已验证解的记忆规模来实现,提供了一条新的 scaling 路径。
行业类比
类似于编译型语言的缓存机制——将已验证的程序编译成可执行文件,下次运行无需重新编译,直接加载执行,获得完全一致的结果。该工作将这种思想引入 LLM 推理,用精确的记忆寻址替代每一次的生成推理。
核心洞察
- **冻结模型 + 验证记忆**,传统模型改进依赖参数扩展或重新训练,每次查询都需要推理生成,结果非确定且成本高昂。本工作提出将已解决并独立验证的问题族答案持久存储,模型冻结不变,新实例通过精确匹配直接返回位精确结果,实现零 token 生成、100% 准确率、确定性。这与依赖近似检索或缓存的方案(如 RAG、提示缓存)根本不同:后者引入噪声且不可靠,而本文通过验证优先的写入机制,确保存储知识绝对可信,将能力从算力消耗转移到知识复用。
- **验证优先的可复用知识库**,现有记忆增强方法如 RAG 依赖向量相似检索,召回错误率高,实验中在 4500 条验证存储上错误率达 94.3%,而本文采用精确寻址实现零错误匹配。更重要的是,存储内容必须通过独立验证(不依赖答案密钥)才能写入,保证了知识库的绝对可靠性。这种‘验证后存储’的契约,不同于常规缓存或经验记忆的随意存留,从根本上保障了零 token 复用时的输出正确性,为安全关键任务提供了新范式。
方法
系统架构
该方法由一个 冻结的 12B 参数基础模型 和一个不断增长的 已验证解决方案记忆库 (verified store) 组成。工作流程遵循“输入 → 检索 → 验证 → 存储/输出”闭环:
- 输入问题 首先经过 精确寻址检索 (exact lookup),在记忆库中查找相同或等价问题族的已验证解。
- 若命中,直接返回位精确 (bit-exact) 答案,消耗 零生成 token,延迟低至 6–23 ms。
- 若未命中,则由冻结模型生成候选答案,送入 独立验证模块。验证器不访问答案键 (answer key),仅依赖问题约束进行校验,确保存储内容绝对正确。
- 验证通过后,该解存入记忆库,后续同类问题永久复用;验证失败则拒绝存储,避免污染记忆。
关键模块
- 精确寻址记忆:采用确定性哈希或等价匹配,在 4,500 项的已验证存储上实现零错误检索,而近似相似性检索的错误率高达 94.3%。选择开销仅 1.4 µs。
- 独立验证合约 (verify-before-store):验证逻辑独立于模型生成,通过形式化或程序化检查保证正确性,使记忆库成为可信知识源。
- 大规模工作上下文:记忆库同时可作为 6,000,000 token 可移动窗口 直接注入模型,在单张 46 GB GPU 上实现 flat memory 推理,远超 vLLM(30,399 token 上限)和 SGLang(32,000 token 后静默截断)。
- 多架构解耦:在 4 种不同供应商的 密集 (dense) 与 混合专家 (MoE) 架构上,180/180 新实例零生成 token 通过,证明能力来自记忆而非参数扩展。
与同类方法的差异
该方法与 推理缓存 (KV cache) 或 检索增强生成 (RAG) 的本质区别在于:它存储的是 已验证的最终输出,而非中间状态或未经验证的外部文档;通过验证合约实现 100% 确定性复现,将执行绑定能力与模型推理成本彻底剥离,达成“一次验证,永久复用”的工程范式。
实验
实验设计
基于冻结的 12B 参数模型,构建一个持久化记忆库,存储已验证的问题解答。解答必须经过独立验证步骤(不查阅答案键),验证通过后存入记忆。测试涵盖 9 个问题家族 的 180 个全新实例,以及 88 个开放推理案例,覆盖 4 种模型架构(dense 与 Mixture-of-Experts),来自四个不同供应商。记忆采用精确寻址而非相似度检索,以消除近似匹配的固有错误。
关键发现
- 100% 准确率、零生成令牌:所有已验证问题家族的新实例,直接从记忆返回位精确答案,无需任何生成过程,回答确定性且永久不变。
- 极速检索与极低能耗:记忆选择仅需 1.4 微秒,完整复用流程 6-23 ms,能耗 36 mWh,比常规推理快数个数量级。
- 近似检索失效:在 4,500 条已验证记忆 上,相似度检索的错误率高达 94.3%,而精确寻址为零错误,突出了本系统对精确匹配的依赖。
- 超大上下文窗口:记忆库可作为工作上下文,支持单张 46GB GPU 上 600 万 token 的可移动窗口,超越当前主流推理引擎(vLLM 仅支持 30,399 token,SGLang 静默截断至 32,000 token)。
与基线对比的深入解读
在从头原始推理的公开基准上,前沿模型仍显著优于任何 12B 模型;然而,在本系统所有已解决并验证的问题上,局势完全反转:
| 对比维度 | 前沿模型 | 本系统 |
|---|---|---|
| 推理方式 | 每次查询重新生成 | 记忆直接返回,零生成 |
| 输出确定性 | 非确定性 | 位精确,永久不变 |
| 单次成本 | 高(计算量、延迟、能耗) | 极低(6-23ms,36mWh) |
这一设计将能力与参数规模解耦,展示了通过持久验证记忆可以将已有推理成果无限复用,无需反复消耗算力,对高频、确定性需求场景有直接工程参考价值。
原作者论断:“前沿 API 调用在每次查询时支付一次全新的生成过程,永远如此;而已验证复用成本为零令牌,每次返回相同的位串。” 验证-存储-复用合约是可靠性的基石。
行业影响
落地场景
该系统最直接的应用是高频、问题族固定的确定性问答场景。例如:
- 企业客服:将已验证的客户问题-标准答案存入记忆,覆盖80%+的重复咨询,实现零延迟、零幻觉的即时回复。
- 自动化测试:在持续集成中,对已知代码变更生成固定测试用例,确保每次回归的一致性。
- 标准化教育:题库解答中,一旦某道题的解题过程被验证,后续相同提问直接返回位精确答案,避免模型随机性导致评分差异。
- 金融合规:法规解读、合规检查清单等可预先验证并固化,确保每次输出完全一致,满足审计要求。
商业价值
核心价值在于推理成本的极致压缩和可靠性的绝对提升。
- 大幅降本:已验证问题答案复用,推理成本从按token计费降为零,在大型部署中可节省90%以上的GPU时支出。
- 体验跃升:响应时间从秒级降至毫秒级(6–23 ms),用户感知延迟消失,适用于高并发、低延迟要求的产品。
- 信任增强:“验证后存储”的合约保证输出100%准确且位精确,消除大模型幻觉带来的业务风险,使AI在金融、医疗等严格领域真正可用。
- 绿色计算:单次重用仅耗36 mWh,助力碳中和目标下的可持续AI部署。
与现有产品/工作流的接口
该技术可作为推理缓存中间件,无缝嵌入现有LLM栈:
- 在模型推理网关前增加一层精确匹配记忆库,请求先查询记忆(1.4 μs 选择 + 6–23 ms 完整重建)。若命中则直接返回,否则调下游模型生成并触发验证流水线。
- 记忆库可独立部署,仅需46 GB显存支撑6百万token工作窗口,优于vLLM(3万token截断)和SGLang(3.2万静默截断),适合作为超长文档的确定性上下文缓存。
- 与向量检索系统互补,但作者警告近似检索在已验证存储上错误率高达94.3%,因此必须使用精确寻址。可设计两级结构:先用向量缩小范围,再精确匹配。
- 导出接口为REST/gRPC端点,与LangChain、Semantic Kernel等编排框架兼容,只需在提示模板前插入
cache_lookup(problem_family, instance_hash)调用即可。
典型集成场景:一家全球电商平台在节假日高峰期使用该记忆层处理数百万次同质化问询(如物流查询、退换货政策),将大模型调用量削减95%,同时保证所有回复经过人工审核验证,零错误。金融客服系统集成后,合规问答输出与官方文件完全一致,通过每一次监管审计。
局限
- **依赖已验证问题族的先验记忆构建**:系统能力完全来自外部记忆库中已验证的解决方案,对于记忆库未覆盖的全新问题族,仍然需要模型自身的推理能力或人工/自动验证流程从零建立新条目。这意味着该方法本质上是确定性缓存,无法提升模型解决开放域新问题的上限,且记忆库的构建、维护与验证成本会随问题空间扩大而增长,在高度动态或开放域任务中长期可用性受限。
- **独立验证机制难以泛化到主观任务**:验证步骤要求“不查阅答案”而独立判断,这通常依赖客观评判标准(如数学证明、代码执行结果)。对于创意写作、开放对话、策略建议等缺乏明确真值的主观性任务,设计可靠自动验证器极为困难,导致该方法的应用范围被局限在具有可形式化验证的领域,通用性不足。
- **检索依赖精确匹配,鲁棒性有限**:论文指出在4500条存储上近似相似性检索错误率达94.3%,而精确寻址(exact addressing)才保证零错误。这意味着系统对输入表述的细微变化(如同义改写、参数数值变动)极度敏感,无法像向量检索那样容忍语义相似但字面不匹配的变体。当问题实例的表述稍有差异即导致缓存未命中,实用性在真实场景中可能大幅下降,且扩展到更大规模记忆库时如何维持精确匹配的效率和覆盖率仍是挑战。