Qwen-Planner-Agent: 面向真实世界移动 Planner Agents 的闭环 AI-for-AI 框架
大语言模型正把 AI 从被动的内容生成推向工程与科学发现的主动工作流,由此引出一个问题:AI 能否既是开发的对象,又是构建下一代 AI 系统的参与者?移动规划是这一设想的严苛检验场景:长程复杂任务挑战 agent 的可靠性,而真机交互的高成本又限制了开发的可扩展性。 我们在闭环 AI-for-AI 框架内构建 Qwen-Planner-Agent,并以共享的 action-feedback-verification 契约串联数据生产、模型训练与部署: 1. AI for Data: 人工把关的 agentic 数据飞轮,由专用 agent 构造任务、采集交互轨迹、筛选并平衡训练数据,并利用训练反馈指导后续数据生成。 2. AI for Training: 监督式 planning 冷启动结合混合环境下的在线 agentic 强化学习,并提出 CARE(Competence-Aware Reward-and-Advantage Engineering),在保持任务表现的同时降低推理与工具使用成本。 3. AI drives model-harness co-evolution: 通过执行证据驱动的循环,在运行时编排 memory、skills 与 tools,并把结构化动作反馈与保留的失败轨迹回灌到模型与 harness 的协同适配中。 Qwen-Planner-Agent 在 MobilePA-Bench 上取得所有被评估模型与系统中的最佳整体表现,在 tool use、memory、skills 与 sub-agent coordination 上均超越其基座模型;在多个非移动类 agentic benchmark 上也有提升,并基本保留了通用能力。
论文精读
TL;DR Qwen-Planner-Agent 构建闭环 AI-for-AI 框架,打通数据飞轮、混合环境强化学习与模型-运行时协同进化,在 MobilePA-Bench 上取得最佳综合表现,显著提升移动规划智能体的工具使用、记忆与子代理协调能力。
问题
问题背景
LLM 正从被动内容生成扩展到主动执行工作流,移动端规划智能体(mobile planner agents)成为关键应用方向,但可靠性仍远低于人工操作。
现有方法局限
- 数据侧:依赖静态数据集或人工演示,缺乏与环境交互的反馈闭环,难以覆盖长尾场景;真实设备采集成本高,模拟数据存在 sim-to-real gap。
- 训练侧:监督微调(SFT)缺少奖励信号,强化学习(RL)在移动环境中的在线交互昂贵,且奖励/优势估计未考虑模型能力差异,导致探索低效、推理开销大。
- 部署侧:模型与工具/记忆等 harness 组件割裂,训练后无法持续从执行证据中学习,导致任务失败后难以迭代改进。
为什么这个问题难/重要
移动规划任务具有长时程依赖、动态界面、多工具协同和隐私约束,错误操作会直接影响真实设备状态。业界对移动智能助手的需求强烈,但缺乏可扩展的开发范式:既要保证任务成功率,又要控制真实设备交互成本和推理延迟。现有方法难以在性能与效率之间平衡。
行业类比
如同自动驾驶依赖“影子模式”与仿真回灌形成数据闭环,移动智能体也需要一条从任务构建、轨迹采集到训练部署的闭环流水线,才能从真实执行反馈中持续提升。
核心洞察
- 闭环AI-for-AI框架将数据生产、模型训练与部署环节通过统一的action-feedback-verification契约耦合,让AI参与自身迭代而非静态流水线。相比通常分别优化数据采集、奖励函数或推理工具的范式,该框架利用训练反馈指导数据生成,并以执行证据驱动模型与harness协同演化,形成可扩展的闭环,降低对真实设备交互的依赖,更适合长流程移动规划任务的迭代开发。
- CARE在agentic强化学习中引入能力感知的奖励调度与优势校准,根据模型当前能力动态调整优化信号。不同于固定奖励或单纯减少采样步数的方法,CARE显式平衡探索与利用,在保持任务性能的同时降低推理和工具使用成本,这对于长horizon、高交互成本的移动规划训练尤为关键,使在线强化学习在资源受限环境下可行。
- 模型-harness协同演化将记忆、技能与工具视为可学习组件,通过执行证据驱动的运行时编排与失败轨迹反馈联合更新。与固定harness或仅微调模型不同,该工作从真实执行失败中提取结构化反馈,同时更新模型参数和harness配置,从而在MobilePA-Bench上超越基线,并提升非移动agentic基准,同时保持通用能力,证明了harness与模型同步进化的必要性。
方法
输入
移动规划任务描述、当前设备状态、历史交互轨迹与上下文。
关键模块
- AI for Data(数据飞轮): 由专用智能体构建任务、收集交互轨迹,经人工门控进行数据策展与平衡,并根据训练反馈迭代优化数据生成。
- AI for Training(训练): 先以监督规划冷启动,再在混合环境(仿真与真实设备)中进行在线RL。引入 CARE(能力感知奖励与优势工程),包含能力自适应奖励调度、AI辅助时程配置、质量保持的优势校准,以降低推理与工具调用成本。
- AI for Harness(运行时协同演化): 统一模型-工具运行时,通过执行证据驱动循环编排记忆、技能与工具。采用情境条件技能引导和证据锚定的持久记忆,并启用隐私保护。将结构化动作反馈和失败轨迹回馈至模型与harness的协同适配。
输出
训练得到的 Qwen-Planner-Agent 在 MobilePA-Bench 上取得整体最优,并在工具使用、记忆、技能与子代理协调方面相对基座模型提升。
差异点
与单独优化模型参数或静态工具链的方法不同,该框架通过闭环 AI-for-AI 将数据生产、训练与运行时harness协同演化,在保持任务性能的同时降低开发与推理成本。
实验
实验设计
论文在 MobilePA-Bench 上评估 Qwen-Planner-Agent,并搭配长历史记忆测试与通用智能体基准。训练侧采用混合环境在线 RL,引入 CARE 动态调度奖励与优势校准,对比冷启动监督学习与消融实验。
关键发现
Qwen-Planner-Agent 在 MobilePA-Bench 上取得最佳整体性能,超越基础模型及其他系统。提升覆盖工具调用、持久记忆、技能执行与子代理协调;在非移动 agentic benchmarks 上亦有改进,且通用能力未明显退化。消融显示 CARE 训练动态显著降低推理与工具开销,harness 贡献独立于模型 checkpoint 存在。
基线对比解读
不同于单纯放大模型或独立 RL 管线,该工作通过模型–harness 协同进化,将执行反馈回流到模型与 harness 联合适配,在同等模型规模下解锁额外收益。对比基础模型,闭环 AI-for-AI 框架利用数据飞轮与混合环境 RL,既提升任务成功率,又控制交互成本,体现 AI 参与构建 AI 系统的工程可行性。
行业影响
落地场景
移动端复杂任务自动化是核心落点,例如电商 App 中的跨应用比价与下单、企业级移动办公中的多步审批与信息整合。该框架可直接用于构建下一代手机助手,处理长流程、多工具调用的规划任务。
商业价值
- 降本:AI-for-AI 数据飞轮减少人工标注与真机测试开销,混合环境训练降低对昂贵真实设备的依赖。
- 增收/体验:更高的任务完成率与可靠性可提升用户留存及付费转化;模型与执行体协同进化让产品具备持续迭代能力。
接口与集成
- 通过统一的
action-feedback-verification协议与现有工具/API 对接,可作为规划模块嵌入 LangChain、AutoGen 等 Agent 框架。 - 记忆与技能管理以可插拔 harness 形式集成到移动 App 后端,无需重构现有服务。
具体用例:
- 电商比价助手:用户语音指令“买性价比最高的降噪耳机”,智能体跨多个购物 App 搜索、比较、加入购物车并完成下单,全程自动调用工具并维护记忆。
- 移动 CRM 自动化:自动汇总客户沟通记录、生成跟进任务并更新销售管线,减少销售手动录入时间。
局限
- **混合环境训练与真实设备执行之间存在 sim-to-real gap**。论文通过互补的环境后端(仿真与真实设备)降低交互成本,但训练主要依赖混合环境,模型在仿真中学习到的策略未必能完全迁移到真实手机。真实设备上的系统响应延迟、触控坐标精度、应用版本差异、弹窗干扰等因素难以在仿真中精确建模,可能导致策略在实际部署时性能下降。论文未系统报告在纯真实设备上的长程任务成功率,也未量化环境差异对最终策略的影响,因此其在真实世界移动规划中的可靠性仍有待验证。
- **数据飞轮中的人工 gating 环节限制了完全自动化和规模化扩展**。虽然 paper 设计了 agentic data flywheel,由多个专用 agent 自动构建任务、采集轨迹并做初步筛选,但最终的数据清洗、平衡和准入仍需人工审核。这种 human-gated 机制在数据量急剧增大或需要覆盖极端长尾场景时,人力成本会成为瓶颈,且人工判断标准可能引入主观偏差。论文没有讨论如何逐步降低人工参与度,或利用模型自身判断实现更自动化的数据质量闭环,这限制了框架在大规模持续学习中的部署效率。
- **评估基准的覆盖范围与通用能力保持验证不够充分**。论文在 MobilePA-Bench 上取得最佳总体性能,但该基准主要针对移动规划任务,可能无法反映真实世界移动 agent 面临的复杂对话、多应用协同、权限管理等多样性挑战。此外,虽然论文提到对非移动 agentic benchmark 的改进,但对通用能力保持的评估相对有限,尤其在长上下文、推理和 safety 维度上未做深入对比。因此,模型在真实跨领域任务上的泛化能力和潜在能力退化风险尚不完全明确。