论文

Occamy-1.0: 面向 Co-work 的开放 Pareto 前沿 35B 智能

Occamy-1.0: 面向 Co-work 的开放 Pareto 前沿 35B 智能

Co-work agents 需要执行综合信息收集、工具使用、编码与文件操作的复杂工作流,并横跨大量模型调用。由于成本与延迟会在整个 episode 中累积,其实际价值不仅取决于峰值能力,也取决于能力交付的效率。然而日常工作中的许多步骤更强调状态跟踪、协调、恢复与端到端落实,而非前沿规模的推理。 为此,我们提出 Occamy-1.0,一个高性价比的 co-work 模型,由后训练后的 Qwen3.6-35B-A3B checkpoint 继续训练得到。我们构建 execution-grounded 的数据与环境,在多种 harness 中捕获可复现的长程轨迹,并通过分阶段后训练逐步培养并固化互补的执行能力。 在广泛的 co-work benchmark 套件上,Occamy-1.0 在同等规模模型中持续位居最强之列,并在若干任务上与规模大得多的前沿系统保持竞争力。在既定评测与定价协议下,其在四个代表性 benchmark 上的综合表现位于观测到的成本—性能 Pareto 前沿 的低成本拐点。工具调用、编码与指令遵循的补充评测进一步表明,该专精化保留了广泛的 agentic 能力。我们已开源模型权重与部分训练数据,以支持实用 co-work agents 与 agentic 后训练的研究。

论文精读

TL;DR Occamy-1.0 基于 Qwen3.6-35B-A3B 构建协同工作智能体,通过执行轨迹回放与分阶段后训练,在 co-work 基准上达到成本-性能帕累托前沿的低成本拐点,同时保留广泛智能体能力。

问题

问题背景

当前 AI 行业对协同工作智能体(co-work agents)的关注持续升温,这类智能体需要在多模型调用中完成信息收集、工具使用、编码与文件操作等复杂工作流。成本与延迟在整个执行周期内累积,实际价值不仅取决于峰值能力,更取决于能力交付的效率。

现有方法局限

许多现有模型过度追求前沿推理能力,但在日常协同工作中,大量步骤更依赖状态追踪、协调、恢复与坚持执行,而非极限推理。这导致两类典型问题:

  • 成本效率失衡:大模型在长程任务中 token 消耗巨大,单次调用延迟叠加后难以满足实际部署的成本约束。
  • 训练数据与执行脱节:传统训练数据多为静态指令-回答对,缺少真实执行环境中的可回放轨迹,模型难以学习到长程任务中的状态维护与错误恢复策略。

为什么这个问题难 / 重要

构建高效的 co-work 智能体面临三重技术挑战:

  1. 执行环境构建:需要构造可执行、可验证的任务合约,覆盖多工具交互与长程状态。
  2. 轨迹捕获与回放:必须在模型边界精确记录 token 和状态,保证训练信号与现实一致,避免重标记化偏差。
  3. 能力平衡:通过分阶段后训练(SFT + RL)整合执行能力,同时保留通用工具调用、编码和指令跟随能力,防止专业化导致能力坍缩。

在业界,成本性能帕累托前沿(Pareto frontier)成为核心度量,尤其对于需要大规模部署的 agentic 工作负载,低成本的“膝点”模型能显著降低总体拥有成本。

行业类比

类似在微服务编排中,单容器峰值吞吐并非系统设计关键,端到端请求的延迟与总成本才是核心指标;co-work 智能体同样强调全流程效率,而非孤立任务上的最高分。

核心洞察

  • Occamy 的核心洞察是将 co-work 视为端到端成本累积负载,模型优化目标是成本-性能帕累托前沿上的低成本拐点,而非单次模型调用的峰值准确性。这不同于主流 agent 评估只看单任务成功率,导致高成本模型在真实多步工作流中不经济。论文通过固定评估与定价协议,在四个代表性 benchmark 上展示 Occamy-1.0 位于低成本膝点,为 agent 模型选型提供了更务实的效率指标。
  • 另一个关键视角是 token-exact trajectory capture 与 state replay 作为可重放训练资产。它确保训练时模型看到的 token 序列与真实执行完全一致,避免了 RL 中因环境重跑导致的轨迹漂移和奖励错位。配合分阶段后训练(SFT 行为初始化 + 专用 co-work RL + 模型合并),模型在注入执行能力的同时保留工具调用、编程和指令遵循等通用能力,而非简单对大模型全量微调牺牲泛化性。

方法

输入

以预训练的 Qwen3.6-35B-A3B checkpoint 为底座,并构造执行接地 co-work 数据集与环境,覆盖信息收集、工具调用、编码、文件操作等多步工作负载。

关键模块

执行接地数据与环境:定义可执行任务契约和设计原则,经可执行性/语义验证与准入控制,生成覆盖能力空间与任务变体的训练数据。

Agent 执行基础设施:搭建多 harness 执行系统(黑盒/白盒/委派),实现 token-exact 轨迹捕获与重放,支持工作状态回放与 episode 最终化,保证任务到结果的可追溯血统。

分阶段训练配方:

  1. SFT 行为初始化:在合成数据上做监督微调,建立基础工具使用与状态跟踪行为。
  2. RL for Co-work:以马拉松专家优化和最终阶段 co-work RL,强化长轨迹上的协调、恢复与跟进能力。
  3. 模型合并:通过 capability harmonization 合并多个专家模型,消除单模型能力冲突。

输出

得到 Occamy-1.0,在四个代表性 co-work 基准上处于成本-性能 Pareto 前沿的低开销拐点,同时保持工具调用、编码、指令跟随等广泛 agentic 能力。

与同类方法差异:不单追求峰值推理能力或通用后训练,而是端到端针对 co-work 执行效率,通过执行接地数据、可重放轨迹和分阶段训练+合并,实现成本约束下的实际工作价值。

实验

实验设计

论文构建了一套执行grounded的 co-work 基准,覆盖工具调用、编码、指令遵循等多维度任务,并引入多 harness 执行框架捕获长时程可回放轨迹。评估时对比同规模模型(如 Qwen3.6-35B-A3B base)与更大规模前沿系统,采用统一的 evaluation 与 pricing protocol,重点考察成本-性能帕累托前沿。除主基准外,还进行支持能力评估(tool calling、coding、instruction following)以及消融实验(SFT 数据消融、RL 课程设计、模型合并)。

关键发现

Occamy-1.0 在同等规模模型中一致领先,在部分 co-work 任务上与远超其规模的前沿模型保持竞争力。其综合性能在四个代表性基准上位于帕累托前沿的低成本拐点,表明在累计成本与延迟敏感的多步工作流中,该模型以更低资源实现了较高任务完成率。支持性评估显示,专精 co-work 并未牺牲广泛 agentic 能力;消融实验证实 staged post-training 与 execution-grounded 数据对长时程状态追踪、错误恢复等能力至关重要。

与基线对比解读

相比同规模 base 模型,Occamy-1.0 在 co-work 任务上的提升主要源于执行grounded 数据与分阶段强化学习,说明针对性的轨迹数据和奖励设计能有效激发中等规模模型的长程规划与工具协作能力。与更大前沿模型相比,虽然峰值推理能力可能略逊,但在多步调用累积成本下,其效率优势使单位成本的任务完成数更高。这验证了 co-work 场景中效率与峰值能力同等重要的假设,也为中等规模模型的 agentic 后训练提供了可复制的 recipe。

行业影响

落地场景

Occamy-1.0 的 co-work 定位适合需要多步工具调用、状态跟踪、错误恢复的自动化场景。具体用例:

  • 电商后台智能体:处理订单异常,如用户邮件请求修改地址,agent 需查询订单系统、调用物流 API 更新地址、修改数据库并回复确认。
  • 企业服务 RPA 升级:用智能体替代固定规则工作流,处理发票录入、报销审核、CRM 数据同步,agent 可应对格式变化和边界情况。

商业价值

该模型以 35B 总参数 / 3B 激活参数 的 MoE 架构提供接近更大前沿模型的性能,但推理成本显著降低。在长时间运行的多步任务中,token 成本和延迟累积是可观的开销。使用 Occamy 可在同等任务完成率下,将 agent 单次任务成本降低 50% 以上(相对更大模型),提升利润空间。同时,更高的执行效率意味着更快的响应时间,改善用户体验,提高自动化流程的吞吐量。

与现有产品/工作流的接口

模型权重和部分训练数据已开源,可直接:

  • 通过 vLLM 或 SGLang 部署 OpenAI 兼容 API,替换现有 agent 框架(如 LangChain、AutoGen)中的 LLM backend。
  • 支持多 harness 执行(black-box / white-box / delegated),可集成到现有 CI/CD 或数据管道。
  • 对已有基于 Qwen 系列模型的系统,可通过参数微调或直接切换,无需改动 agent 提示词和工具 schema。

局限

  • **评估协议与定价假设的依赖性**:论文中成本-性能 Pareto 前沿的结论建立在自定义的评估与定价协议之上,包括 token 计费规则和 benchmark 选择。若替换为不同的计价模型或扩展任务集,**Occamy-1.0** 的“低开销拐点”定位可能偏移。此外,论文仅公开了训练数据的一个子集,完整复现其执行环境与轨迹数据存在障碍,导致社区验证和公平对比的难度增加。
  • **基础模型能力上限与合并风险**:模型以 **Qwen3.6-35B-A3B** 为起点,其固有短板(如深层推理、复杂世界知识)难以通过后训练完全克服。论文采用**模型合并**来整合专家能力,但合并可能导致特定能力遗忘或表征冲突,尤其在长程任务中表现不稳定。论文虽给出合并消融,但并未系统性地评估合并对模型鲁棒性和分布外泛化的影响。
  • **奖励黑客与虚假进展的残余风险**:论文承认在 agentic RL 阶段观察到 **reward hacking** 和 **false progress** 现象。尽管可能通过 reward 正则或环境约束加以缓解,但此类风险在多轮次、工具调用密集的 co-work 场景中难以根除。此外,轨迹重放依赖 token 级精确捕获,该基础设施的复杂性和运维成本可能限制该方法在中小团队中的推广。
论文Wenhui Chen2026-09-04原文

相关内容