BDH-CQ: 基于循环潜在推理的上下文学习
我们提出 BDH-CQ,一个结合上下文学习与循环潜在推理的推理模型。推理时呈现的输入会持续更新模型的循环记忆;模型随后在高维潜在空间中进行迭代计算来求解查询,而不需要将中间推理过程言语化。 我们在公开的 ARC-AGI-1 评估集上评测模型,并通过受控的类 ARC 干预,研究模型从示范中学到了什么、对推断出的变换的应用一致性如何,以及哪些概念仍然困难。一个 1.5 亿参数的配置在推理成本仅为 0.0007 美元/任务 的情况下达到 29.5% pass@2。 该运行点突破了此前报道的 ARC-AGI-1 成本-准确率帕累托前沿,在基准成本效率上确立了新的最先进水平。
论文精读
TL;DR BDH-CQ 用循环潜在推理实现上下文学习,在 ARC-AGI-1 上以 150M 参数、$0.0007/任务的成本达到 29.5% pass@2,刷新 benchmark 成本效率前沿。
问题
问题背景
当前 AI 推理研究高度关注 上下文学习 (in-context learning) 与 抽象推理基准(如 ARC-AGI-1)的结合,期望模型仅通过少量示例(few-shot demonstrations)就能推断出隐含的转换规则,并应用于新样本。这要求模型同时具备模式归纳、概念组合与任务泛化能力,是通往通用推理的重要一步。
现有方法局限
主流方案大致分为两类:
- 语言化推理模型(如链式思考,Chain-of-Thought):通过逐步生成自然语言解释来提高推理质量,但显式中间步骤导致推理成本随 token 数线性增长,且语言表达本身可能成为抽象视觉推理(如图像变换)的瓶颈。
- 潜在推理模型(latent reasoning):在连续隐空间迭代计算,避免显式语言化,但现有工作多依赖单任务微调或缺乏有效的上下文记忆机制,无法从多个演示中持续积累信息并动态更新内部表征。
这导致在 ARC-AGI-1 这类需要高度系统化、从稀疏演示中推断复杂变换的基准上,要么推理成本过高,要么准确率远低于人类水平,难以突破成本–准确率的 帕累托前沿。
为什么这个问题难且重要
ARC 任务的设计原则是 最小示例、系统泛化:每个任务仅提供 2-4 对输入–输出网格作为演示,要求模型识别出背后的抽象变换(如旋转、数数、对象分割与重组),并应用到未见过的查询网格。
- 技术挑战在于:变换规则往往是组合式的(如先数物体再按颜色排序),且不同任务之间规则截然不同,模型必须纯粹从当前上下文推导,无法依赖训练数据的统计记忆。这使得传统的大规模语言模型(LLM)甚至多模态模型都表现不佳。
- 业界关注度高:ARC 被视为衡量通用智能的”北极星”基准之一,其任务与任何预训练数据分布无关,纯粹测试推理能力,因此在该基准上的进展直接反映模型在开放环境下的适应潜力。
行业类比
这种挑战类似于在资源受限的端侧设备上部署一个通用问题求解器:每次遇到新问题,仅凭几个例子就要实时推断解法,且不能消耗过多计算,恰如手机相册应用需根据用户刚给的几张示例图自动生成复杂滤镜,追求极致的成本效率。
核心洞察
- 循环隐式推理架构打破推理成本与精度的帕累托前沿:BDH-CQ 通过在高维隐空间中进行迭代计算,替代了显式的中间推理步骤(如 Chain-of-Thought),避免了大量 token 生成,将单任务推理成本降至 $0.0007,同时保持 29.5% pass@2 的精度。与依赖语言化推理的方法相比,该架构在保持泛化能力的同时实现了数量级的成本压缩,为资源约束下的推理模型部署提供了新范式。
- 上下文学习与循环记忆动态融合实现任务自适应推理:模型利用推理时提供的演示样本持续更新循环记忆状态,从少量示例中推断出变换规则并一致性地应用于新查询。这种设计使得模型能够快速适应新任务,且论文通过受控实验揭示了其在简单操作符外推上表现良好,但在排序、嵌套等结构上暴露明显边界,为理解上下文学习的内部机制提供了可解释性视角。
方法
输入与任务设定
- 每个 ARC 任务 由若干 演示对 (demo input → demo output 网格) 和 查询输入 组成,目标为预测查询对应的输出网格。
- 输入序列形如
[demo1_in, demo1_out, demo2_in, demo2_out, ..., query_in],经嵌入层映射为固定维度的向量序列。
循环记忆与上下文融合
- 模型采用 循环状态编码器 (基于 BDH 架构的改进),在每次接收一个演示对后,通过 门控机制 更新其高维记忆向量,从而将任务模式 隐式地 编码至该持续状态中。
- 记忆更新过程 无需外显的符号推断,而是通过训练习得如何从示例中提取可泛化的变换规则。
递归潜在推理
- 查询输入与最终的循环记忆状态拼接后,送入一个 迭代推理模块:在恒定步数内 (如 4~16 步),对查询的潜在表示应用 参数共享的循环变换,逐步精炼结果。
- 该过程完全在 连续高维空间 中运行,不生成中间自然语言解释,每一步的输出可视为隐式“思考”的中间态,推理步数可在测试时按算力需求调整。
输出与训练
- 最后一步的隐状态通过 线性解码头 投射回网格空间,直接产生预测的二维标记。
- 训练采用大量 程序化生成的类 ARC 合成数据 (包含多种几何变换、着色逻辑等),以 端到端监督学习 最小化输出与真实网格的交叉熵。
与显式思维链方法的本质差异:BDH‑CQ 将演示信息压缩为单个循环记忆,并在隐空间进行并行化的、非言语的迭代求解,从而以极低推理成本 (单任务约 $0.0007) 突破原有成本‑准确率前沿,且推理深度可动态缩放。
实验
实验设计
模型在公开 ARC-AGI-1 评测集上执行零样本评估,并在 受控 ARC-like 任务 上进行行为干预实验。训练数据混合了多种 ARC 任务变体,支持模型在推理时通过循环记忆更新与隐式推理获取 上下文学习 能力。
关键发现
- 150M 参数 配置在 ARC-AGI-1 上取得 29.5% pass@2,推理成本仅 $0.0007/任务,突破此前报告的成本-准确率帕累托前沿,成为该基准上 成本效率新 SOTA。
- 行为分析揭示:模型对 简单算子外推 良好,但 顺序与嵌套操作 引入明显边界;上下文绑定 能处理密集映射,但组合性依赖操作类型;任务内一致性高,标识符复制 和 批量上下文复制 等概念仍是难点。
- 增加推理迭代步数可进一步提升 pass@2,验证了循环隐式推理的算力可扩展性。
与基线对比
此前 ARC-AGI-1 上的主流方案依赖大型语言模型的 显式思维链推理 或 程序合成,计算开销远高于 BDH-CQ。该工作以不到 200M 参数和极低成本实现了有竞争力的准确率,证明 循环隐式推理 在抽象视觉推理任务中可以实现高效泛化,为边缘端或低成本推理场景提供了新范式。
行业影响
落地场景
BDH-CQ 的 低成本、高推理效率 特性使其可嵌入资源受限的实时推理系统。典型应用包括:
- 教育科技:交互式习题解答与个性化辅导,模型从少量示例中学会变换规则(如数学图形推理)并直接输出答案,无需冗长的中间生成。
- 工业视觉检测:在产线上利用少量示范快速适应新的缺陷判定逻辑(如表面纹理异常分类),且每次推理仅 $0.0007 的成本允许高频调用。
- 自动化代码修复:根据上下文示例推断代码变形规则,对批量代码进行模式转换,减少人工干预。
商业价值
核心价值在于 突破成本—精度帕累托前沿,实现极低推理开销下的可接受准确率。
- 降本:单任务推理成本不到 0.1 美分,远低于 LLM 的 token 收费模式,使大规模、高频推理在经济上可行。
- 增收:支持将 AI 推理嵌入利润率敏感的业务流程(如边缘设备、消费级应用),开拓此前因模型成本过高而无法商业化的长尾场景。
- 体验提升:循环潜在推理 避免长篇 verbalized chain-of-thought,响应时间更短,适合交互式产品。
与现有产品/工作流的接口
BDH-CQ 可作为轻量化 推理微服务 集成进现有技术栈:
- 通过 REST API 或 ONNX Runtime 部署,接收上下文示例和查询,返回离散输出(如网格、类别标签)。
- 与 LLM 代理 配合:LLM 负责任务分解与指令生成,BDH-CQ 处理需要反复应用同一变换的结构化子任务,如批量表格数据清洗或图形逻辑推演。
- 可利用 Pathway 提供的 项目页面 及 工具集 快速生成训练数据并微调特定领域的概念,实现低成本定制。
具体落地 use case:
- 电商商品属性批量映射:给定少量示范(如“红色→Carmine,蓝色→Azure”),模型在循环潜在空间中学习映射规则,对百万级 SKU 的原始颜色描述进行标准化,无需为每种新映射规则重新训练。
- 金融文档结构抽取:根据少量标注样本(如发票布局),模型迭代推断表格的行列对应关系,从扫描文件中提取键值对,替代固定的模板解析器,应对格式频繁变动的多供应商场景。
局限
- **基准评估范围有限,绝对性能偏低**。模型仅在 **ARC-AGI-1** 上验证,该基准主要考察抽象视觉推理,与现实应用差距较大。虽然达到了成本效率前沿,但 **29.5% 的 pass@2** 准确率意味着多数任务仍无法正确求解,距离实用水平尚远。论文未在其他推理或逻辑基准上进行零样本或少样本测试,**跨任务泛化能力** 不明。
- **隐式推理缺乏可解释性**。BDH-CQ 在**高维潜在空间**中迭代计算,不产生可读的中间步骤,因此难以诊断错误、审计推理过程或建立用户信任。在需要解释性的场景(如医疗、法律)中,这类“黑箱”推理模型可能不被接受,相比于显式链式思考方法存在劣势。
- **训练数据依赖性强,概念泛化边界敏感**。模型性能受益于 **ARC 风格任务生成器** 生成的合成数据,其学习的模式可能与特定分布强相关。论文行为分析表明,**顺序、嵌套、组合** 等概念仍构成明显挑战,模型对这些结构化变化的鲁棒性有限,数据分布偏移可能导致性能骤降。