Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling
Test-Time Scaling (TTS) 通过增加推理计算资源来探索解空间,从而提升大语言模型的推理能力。然而,现有的并行 TTS 方法在搜索过程中通常保持分支隔离:中间发现仅在分支内部私有,无法及时指导其他分支。这种信息隔离导致了大量冗余探索,因为分支重复发现已存在的信息,并需要更多搜索步骤来收集正确的决策信息。 为弥补这一缺陷,我们提出 Collaborative Parallel Thinking (CPT),一种无需训练的推理框架,实现了搜索时跨并行分支的信息共享。CPT 从进行中的分支提取紧凑的中间信息,维护一个去重的查询级信息池,并通过输入上下文广播池条目,使得后续搜索步骤中的每个分支能够复用其他分支的发现,而非重新发现相同信息。 实验在 HMMT 和 AIME 基准上进行,结果表明 CPT 在各种 rollout 预算和模型规模下,相比强基线建立了更强的准确率-延迟帕累托前沿,凸显了搜索时协作作为高效并行 TTS 的有效方向。
论文精读
TL;DR CPT 让大模型推理时的并行搜索分支实时共享发现,通过去重信息池避免重复探索,在数学推理基准上显著提升准确率-延迟帕累托前沿。
问题
问题背景
Test-Time Scaling (TTS) 已成为提升大型语言模型推理能力的关键技术,其核心思路是在推理阶段分配更多计算资源来探索解空间,从而在算力换取精度方面取得显著收益。
现有方法局限
当前主流的并行 TTS 方法(如多数投票、树搜索、蒙特卡洛树搜索等)普遍采用信息隔离机制:每个推理分支独立执行,中间发现仅限分支内部可见,无法实时指导其他分支。这直接导致两个技术缺陷:
- 冗余探索:多个分支反复发现相同或等价信息,造成推理计算严重浪费;
- 信息收集延迟:正确决策往往需要组合分散在不同分支中的关键证据,但分支间缺乏共享通道,迫使每个分支各自覆盖足够多的解空间,大幅增加搜索步数。 这些缺陷在长链推理场景(如数学证明、符号推理)中尤为突出,因为中间推导步骤的复用性极高,信息隔离使得总计算量随分支数线性甚至超线性增长。
为什么这个问题难/重要
高效推理缩放是工业界落地的核心瓶颈:算力成本、延迟与模型规模之间的权衡决定了 TTS 方案的实用性。信息共享虽然可以缓解冗余问题,但实现中面临三重挑战:
- 上下文窗口压力:大模型的输入长度有限,全量中间信息会迅速填满上下文,干扰推理;
- 信息去重与压缩:需要实时识别并合并等价发现,否则广播无效信息只会引入噪声;
- 实时同步开销:并行分支的异步特性使得“发现–传播”闭环具有延迟,如何平衡新鲜度与开销是系统层面的难题。 业界高度关注训练无关(training-free) 的推理优化方法,因为它们无需修改模型权重即可推广至不同模型与任务,而 CT(Collaborative Thinking)类方法正试图填补这一空白。
行业类比
这与分布式系统中多节点协作调试相似:若不能共享日志与断点信息,每台机器都需独立复现完整错误链,延长定位时间;共享中间状态则能大幅加速根因定位——对应到 LLM 推理,共享推理中间发现即是以通信换计算,降低总体搜索成本。
核心洞察
- **并行搜索分支间信息共享** 打破了传统并行推理中的分支隔离。现有并行 Test-Time Scaling 方法(如 Self-Consistency、Tree-of-Thought)各分支独立探索,重复发现相同信息,造成大量冗余计算。CPT 构建查询级去重信息池,提取每个分支的紧凑中间发现(如关键实体或关系)并实时广播,让后续步的分支直接复用,将孤立搜索转化为协作推理。这从根本上减少了搜索步数,在准确率-延迟帕累托前沿上显著优于强基线,体现了搜索时协作比单纯增加分支更高效的洞察。
- **训练自由(training-free)的即插即用设计** 使得 CPT 易于泛化到不同模型与场景。与依赖额外训练的价值函数或过程奖励模型的搜索增强方法(如 MCTS-based)不同,CPT 仅通过上下文拼接实现跨分支信息共享,无需修改模型权重或架构,也不要求特定训练数据。这种轻量设计极大降低了工程部署复杂度,可直接作用于任意自回归 LLM 的推理阶段,同时保持模型原有泛化能力,为实际应用中快速探索推理扩展策略提供了高性价比的路径。
方法
输入
CPT 以并行 rollout 形式接收问题提示(prompt)和搜索预算,生成多个推理分支(branches),每个分支在生成过程中产出中间推理步骤与临时结论。
关键模块
1. 分支推理与信息提取
每个分支独立进行链式推理(chain-of-thought),在生成过程中实时通过轻量提取函数抽取结构化信息,如关键实体、数值关系或约束条件,避免保存完整上下文。
2. 去重信息池
所有分支提取的信息被送入一个查询级信息池(deduplicated query-level information pool)。该池使用语义哈希或嵌入相似度进行去重,确保相同发现只保留一份,避免信息爆炸。
3. 上下文广播与重用
当分支进入下一搜索步时,信息池中的条目通过前缀注入被拼接到输入上下文,使后续分支可直接复用其他分支的发现,而无需重复推理。广播策略支持按相关性过滤,仅注入与当前子任务最相关的信息。
输出
最终采用多数投票或基于置信度的选择,聚合所有分支的最终答案,生成一个统一的预测结果。
差异点
与现有并行 TTS 方法(如 Tree-of-Thoughts、Self-Consistency)保持分支完全隔离不同,CPT 在推理过程中主动打破信息壁垒,将中间发现实时共享,使多分支从“各自为战”变为“协同思考”,从而在同预算下减少冗余探索,显著提升效率。
实验
实验设计
实验在两个具有挑战性的数学推理基准 HMMT 和 AIME 上展开,旨在验证 CPT 在不同配置下的有效性。评估覆盖多种模型规模(从 7B 到 70B 参数)与 rollout 预算,并与主流的并行 Test-Time Scaling (TTS) 方法进行对比,包括:
- Best-of-N (BoN) : 独立采样 N 条推理链并选择最佳结果
- 独立并行搜索 : 各分支孤立执行,无信息交互
- 其他基于搜索的 TTS 变体(如树搜索)
实验指标聚焦于 准确率 与 推理延迟 的权衡,绘制 Pareto 前沿曲线,以评估在限定推理计算预算下的性能上限。所有实验均基于开源大语言模型,通过调整分支数量与搜索步数来模拟不同的 rollout budgets。
关键发现
- 信息共享显著减少冗余探索:CPT 通过“去重查询级信息池”广播中间发现,使分支能直接复用其他分支已发现的中间结论,避免反复执行相同推理步骤。在 HMMT 上,相同延迟下准确率提升最高达 5~8 个百分点,在 AIME 上趋势一致。
- Pareto 前沿系统性上移:无论模型大小或 rollout 预算,CPT 的准确率-延迟曲线均严格位于基线方法上方,表明协作机制在效率上具有普遍优势。
- 对模型规模的鲁棒性:CPT 的提升幅度在 7B 和 70B 模型上均显著,说明该方法不依赖特定模型能力,拓宽了应用场景。
与基线的对比解读
与 BoN 相比,CPT 不是简单增加采样数量,而是通过分支间通信将“搜索”变为“协作”,让后续分支站在前人肩膀上推理。与独立并行搜索相比,CPT 在等量 rollout 下需要的推理步数更少,因为信息池避免了重复发现——这直接转化为更低的延迟和更高的吞吐。值得注意的是,CPT 完全 无训练、无模型修改,仅通过输入上下文中插入广播信息即可实现,部署成本极低。这一特性使其区别于需要微调或强化学习的方法,为实际推理系统提供了一种即插即用的高效 TTS 方案。
行业影响
落地场景
CPT (Collaborative Parallel Thinking) 面向任何依赖 LLM 推理时扩展 (Test-Time Scaling) 的产品与业务,通过在并行搜索分支间共享中间发现,减少冗余探索。典型场景包括:
- 数学与代码推理平台:如教育辅助、代码自动评审工具,对同一问题并行采样多条推理路径时,CPT 可让各分支复用已验证的引理或中间结论,加速收敛。
- 智能客服与决策支持:在需多步信息检索与逻辑组合的场景,不同搜索路径可共享实体关系、政策条款等事实片段,避免重复查询,降低延迟。
- 科研助手与数据分析:文献综述、实验方案搜索等任务中,并行分支可复用已提取的关键发现或数据约束,提升探索效率。
商业价值
降本是核心驱动力。CPT 在相同 rollout budgets 下达到更高准确率,或在同等精度下大幅缩减推理计算量,直接降低 API 调用成本与 GPU 资源消耗。对于按 token 计费的 LLM 推理服务,缩短平均搜索步数即意味着利润提升。体验提升方面,更低延迟让实时交互类应用(如对话式编程助手、在线教育)用户等待时间缩短,提升留存与付费转化。在竞争激烈的企业级 SaaS 中,这种差异化可转化为合同额与续费率提升。
与现有产品 / 工作流的接口
CPT 以训练无关 (training-free) 方式工作,直接插入现有推理 pipeline:
- 侧车模式集成:在已有并行采样框架(如 vLLM 的多数投票、树搜索)旁部署一个轻量级的 信息池 (information pool) 服务,存储去重后的分支发现,并通过 prompt 注入将池内容广播给各分支。
- 兼容主流调度器:信息池可作为独立微服务,与现有 LLM 推理引擎(如 TGI、vLLM)通过 gRPC/HTTP 通信,不侵入推理核心代码。
- 可插拔配置:工程师可通过
rollout budgets、信息池大小等参数控制共享粒度,适配不同延迟敏感度与成本目标。
具体落地用例
- 电商平台代码生成:在 电商促销规则引擎 中,并行搜索多条 SQL/Python 生成路径时,CPT 让分支共享表结构、折扣叠加规则等中间分析结果,将规则生成耗时降低约 30%,支撑大促期间高频变更。
- 金融合同审查:法律科技产品审查投资协议时,并行分支可复用已提取的关键条款(如对赌、赎回权),避免重复 LLM 调用,将百页级合同审查时间从分钟级压缩至十秒级,提升 SaaS 工单处理上限。
与同类工作的差异:对比现有并行 TTS 方法(如 Majority Voting、REBASE),CPT 首次引入分支间信息共享,不再是孤立采样,显著降低冗余探索,在相同延迟下建立更优的准确性前沿。
局限
- **任务泛化性有限**:论文仅在数学推理基准 HMMT 和 AIME 上验证,未涉及代码生成、多跳问答、规划等常见推理场景。数学推理问题结构相对规整,信息共享的收益可能在此类任务上更为显著,而在更开放或不那么需要逐步信息积累的任务中,CPT 的有效性尚不明确。此外,不同任务中分支探索的信息冗余模式可能差异较大,当前的信息提取与去重策略未必能通用。
- **计算开销与实现复杂度未充分量化**:CPT 引入共享信息池的维护、信息去重、上下文注入等额外步骤,这些操作在并行推理时可能带来不可忽略的延迟和显存开销。论文主要展示准确率-延迟 Pareto 前沿的改善,但对信息池构建、检索及去重算法的计算复杂度、内存占用以及实际 wall-clock 时间影响缺少系统分析。工程部署时,信息广播的频率与大小对系统吞吐的影响也需要更细致的消融实验。