Apodex 1.1: 扩展复杂工作的智能体能力
通用语言模型能够推理并综合知识,但复杂工作还需与文件、信息源和可执行代码进行持续交互,同时具备状态维护、故障恢复和可验证交付能力。我们称之为工作能力:对真实世界目标持续、可验证的推进。Apodex 1.1 沿两个互补维度发展这一能力:环境扩展 提升可执行文件、搜索和代码环境的多样性与可验证性;智能体协调扩展 训练智能体分解长时程任务、委派并行工作、整合异步结果并重新规划。 共享的执行框架和 AgentOS 跨工具和智能体维护任务状态与来源,训练将环境轨迹和协调痕迹转化为可靠行为。在复杂专业工作、金融、科学研究、数学、编程和搜索等领域,Apodex 1.1 虽使用远小于许多前沿系统的模型,仍达到领先性能区间。350 亿参数的 Apodex 1.1 Mini 进一步以本地可部署形式保持强大工作能力。这些成果将智能体智能植根于随时间完成的有用、可验证工作,推进了我们构建重型求解器以处理高难度长期任务的愿景。
论文精读
TL;DR Apodex 1.1 通过环境扩展与智能体协调训练,让 35B 模型在长周期复杂任务中持续产出可验证结果,达到前沿性能。
问题
问题背景:当前 AI 领域在通用语言模型的推理与知识综合上进展显著,但复杂工作(如金融分析、科研计算、软件工程)需要智能体不仅“想得对”,还要“做得完”:持续操作文件、搜索信息、执行代码,并产出可验证的交付物。这一能力被称为 working capability,即对现实目标做出持续、可验证的进展。
现有方法局限:多数语言模型和早期 Agent 框架仍以单轮或短程任务为主,缺乏长时间任务状态维护、失败恢复与可验证交付机制。具体体现在:
- 环境交互往往局限于固定 API 或少量工具,没有将可执行文件、搜索、代码环境的多样性与可验证性作为训练尺度;
- 长时任务分解、并行子代理协调、异步结果整合能力不足,出现偏差后难以有效重规划;
- 缺少统一执行基座来追踪任务状态与溯源,轨迹难以转化为可靠的训练信号。 因此,这些系统在真实多步任务中容易中断、结果不可审计。
为什么难/重要:复杂工作任务的时序长、反馈稀疏、错误累积,对智能体的协调与执行带宽要求极高。将环境多样性和协调轨迹同时纳入训练是技术难点,需要大规模轨迹数据、强化学习与可回放执行基础设施。业界对自主智能体在办公自动化、科研计算、软件交付等场景的落地需求强烈,更需要模型效率高、可本地部署的解决方案,这正是 Apodex 1.1 试图通过 35B 模型达到领先性能的意义所在。
行业类比:类似于软件开发从单函数代码生成过渡到全仓库级持续集成与交付,需要工具链、编排系统与可验证流水线共同支撑长期任务。
核心洞察
- Agentic intelligence 的核心度量不应该是单步答案正确率,而应该是 completed work:在真实环境中持续、可验证地推进目标。Apodex 1.1 将可执行的文件、搜索和代码环境本身作为 scaling surface,训练数据直接来自工具交互轨迹,而非静态文本。相比多数 benchmark 只覆盖短 horizon 的问答或单次代码生成,这种做法迫使模型学会状态维护、失败恢复和证据对齐,使工作能力成为可训练、可评估的对象。
- 环境扩展(Environment Scaling)是与模型参数扩展并列的 scaling 维度。Apodex 1.1 通过扩大文件世界、搜索世界和代码世界的多样性与难度,并保证验证、隔离和重放,为 agent 提供更丰富的失败模式和奖励信号。现有 agent 训练常在封闭沙盒或有限工具集上进行,难以泛化到长程任务;而环境作为一个 scaling surface 能直接提升模型在真实工作场景中的可靠性。
- Agentic Coordination Scaling 的关键是把长期任务的分解、平行委派、异步结果整合和重规划变成可学习的行为,而不是仅在推理时叠加多智能体或搜索。Apodex Agent Team 使用显式任务板、自适应最大团队努力和证据驱动综合,配合 PIVOT-RL 在关键决策点做局部优化,降低长轨迹稀疏奖励的优化难度。AgentOS 负责跨工具和 agent 的持久状态与执行连续性,这使得协调过程本身具备可验证的工程基础。
方法
输入:复杂真实任务(如专业工作、科研、编码、搜索),用户提供自然语言目标与约束。
关键模块
环境扩展:Apodex 1.1 构建三类可执行环境家族——文件世界(权限与转换)、搜索世界(发现与证据对齐)、代码世界(可执行转换与验证),通过扩大覆盖范围和难度提供可验证的交互表面。
AgentOS:作为长程执行基板,提供持久工作区与工具执行、代理团队协调状态(子代理生命周期)、执行连续性(上下文压力下优雅耗尽预算)、受控工件交付。所有状态与来源可追踪。
Apodex 代理团队:采用交互式自组织团队,将潜在分解显式化为任务板,支持异步人类干预、非对称验证、自适应最大团队努力、证据基合成;多个代理并行委派、整合异步结果并重规划。
训练:在环境轨迹和协调痕迹上做 SFT;再使用 PIVOT-RL 在关键决策点进行局部强化优化,将成功轨迹固化为可靠行为。
输出:可验证的交付工件与任务完成状态,在多个专业 benchmark 达到领先性能,35B 参数 Mini 版本仍保持强工作能力。
与同类通用代理框架相比,Apodex 1.1 将“完成可验证的工作”作为代理智能的核心单元,通过同时扩展环境和代理协调两个维度进行训练,而不是单纯依赖测试时搜索或更大模型。
实验
实验设计
Apodex 1.1 从两条互补维度评估:环境扩展 与 Agentic Coordination Scaling。实验覆盖 file / search / code 三类可执行环境,训练采用 SFT 与 RL (PIVOT-RL),利用环境轨迹与协调序列。执行基座 AgentOS 维护任务状态与溯源。评估协议包含 ReAct 与 Agent Team 两种模式,在专业工作、金融、科学研究、数学、编码、搜索等基准上测试,并引入内部 FrontierSearchBench 和 FrontierResearchBench。
关键发现
- Apodex 1.1 在复杂专业任务上达到领先性能带,即使模型规模明显小于许多前沿系统。
- 35B 参数 Mini 模型在本地可部署条件下保留强大工作能力。
- 通过环境扩展和协调缩放,模型能将奖励信号与可验证的真实任务完成对齐。
与基线对比解读
相比仅依赖语言模型推理的基线,Apodex 1.1 引入执行环境与任务状态维护,直接提升长期任务完成率和可验证交付。作者强调「substantially smaller model」也能达到领先性能,暗示效率优势来自训练与执行架构,而非单纯参数量。与一般 multi-agent 系统相比,其 Asymmetric Verification 和 Adaptive Max Team Effort 可能降低协调开销。
行业影响
落地场景
Apodex 1.1 的 可验证长期任务执行 适用于需要持续交互文件、搜索和代码的业务,如金融尽调、科研数据分析、复杂代码迁移。
- 电商动态定价:agent team 抓取竞品 SKU、运行价格弹性模型,生成可审计调价建议。
- 企业服务代码重构:分派子代理并行处理 legacy 模块,异步集成结果,产出可回滚变更。
商业价值
核心价值在 降低高技能人力成本 与 缩短长周期交付时间。其 environment scaling 和 agentic coordination 将多源信息整合与验证从数天压缩到小时级,且产出 可验证交付,减少人工复核。35B Mini 支持本地部署,兼顾合规与推理成本。
与现有产品/工作流的接口
可通过 AgentOS 作为中间执行层,对接现有 CI/CD、数据仓库和内部 API。execution harness 提供持久工作区与工具执行,封装为 MCP 服务或 REST 接口嵌入现有 stack。相较 LangGraph / AutoGen,其 可执行环境训练 与 协调轨迹 RL 能直接提升长任务成功率。
局限
- 论文构建的 **环境扩展** 与 **AgentOS** 依赖内部执行基础设施,其基准与社区常用基准(如 SWE-bench、WebArena)的对应关系未完全公开,可能影响第三方复现与横向对比。同时,报告的性能“领先带”可能基于部分私有或定制基准,外部验证薄弱。
- 训练细节(数据规模、轨迹来源、RLHF/RL 具体设置)披露不充分;**PIVOT-RL** 的“局部优化”方法虽减少探索成本,但可能限制全局协调策略的泛化。35B 模型在极端长程任务上的可靠性与上下文管理仍需更大规模检验。
- 与同类工作(如 **Voyager**、**Reflexion**、**AutoGen** 等多智能体框架)相比,核心贡献更偏向系统集成与工程化,而非提出全新的学习范式或理论突破;其可扩展性主要依赖于手工设计的环境族和任务板,尚未证明能自动涌现新环境或协调规则。