论文

Macaron-V1: 迈向具有自改进与 Mixture-of-LoRA 的开放持续学习

Macaron-V1: 迈向具有自改进与 Mixture-of-LoRA 的开放持续学习

Macaron-V1 是一个面向体验智能的开放 agent-model 家族,旨在通过真实环境中的经验学习和部署后的持续学习。其系统设计围绕两大目标展开:适应 与 协作。适应通过递归改进版本化的模型-测试平台对实现;协作则采用 Mixture-of-LoRA 架构,冻结基础模型并组合专家 LoRA 适配器。 方法上,Macaron-V1 结合 Model-Harness Co-design 与递归自我改进循环。核心组件包括 UI4A 组件原生 GenUI 测试平台、状态化动作基底、版本化 HCP 合约和智能体强化学习框架 MindForge。旗舰模型 Macaron-V1-Venti 基于 GLM-5.2 基座,集成四个 LoRA(聊天、agent、代码、GenUI);Macaron-V1-Tall 基于 Qwen3.6 的 50B 模型,采用相同设计以支持本地部署。 基础设施方面,Macaron-V1 依托后训练平台 MinT、长上下文强化学习方法 LongStraw 以及针对稀疏 MoE 和 DSA 模型的稳定性技术。我们在 Personal Intelligence、GenUI 与通用能力基准上评估了系统,验证了现有方案的有效性;持续学习与集体智能带来的复合收益仍待探索。

论文精读

TL;DR Macaron-V1 基于混合 LoRA 架构与递归自改进,让大模型在部署后通过多专家协作与强化学习连续从环境经验中自我进化。

问题

问题背景

当前大模型(LLM/LMM)部署后面临的核心挑战是如何持续从实际交互中学习,而非仅依赖静态的离线训练。业界逐渐关注体验式智能(experiential intelligence):模型要在开放世界中通过经验适应新任务、新偏好和新环境,并支持协作式多专家推理。

现有方法局限

传统持续学习方案存在明显瓶颈:

  • 全量微调容易导致灾难性遗忘,且每次更新需重训整个模型,成本高昂。
  • 固定 LoRA 叠加(如 LoRAHub)缺乏动态路由,多个适配器间无屏蔽,可能产生干扰;同时,新增专家时需重新设计组合逻辑,难以做到即插即用的可扩展性。
  • 模型-工具分离导致工具调用经验无法反向优化模型本身,自改进循环断裂。

为什么这个问题难/重要

持续学习既要避免遗忘旧知识,又要高效吸收新技能,同时推理时延和显存占用必须可控。将多个专家模块(如对话、编程、UI 生成)统一到单个模型内,并实现按需路由和训练时动态扩展,涉及架构、算法、基础设施的协同设计。工业界迫切需要一种既能保持基础能力,又能灵活增长新技能的方案,以降低频繁全量更新的成本,并适应多样化部署场景(云端到本地)。

行业类比

就像自动驾驶系统需要在不改变底层车辆动力学模型的前提下,通过即插即用的感知模块(如新增传感器适配器)和持续学习引擎来应对未知路况,Macaron-V1 为语言模型提供了一种类似的模块化持续适应框架。

核心洞察

  • **Mixture-of-LoRA 打破单模型微调的局限,通过动态路由组合多个冻结的 LoRA 专家,既避免多任务冲突,又天然支持持续学习。** 与传统的多任务微调或 adapter 切换不同,MoL 在同一基座上让不同 LoRA 独立维护各自的“视角”,按用户输入实时选择一个适配器,且适配器可随新任务随时扩展,无需全量重训。这为部署后不断吸纳新能力的开放 agent 提供了架构支撑,同时路由开销极低,在工程上平衡了灵活性与效率。
  • **递归自我改进循环将模型与工具链视为版本化整体,通过外部合约评估经验并驱动下一代构建,实现从部署反馈中持续进化。** 该设计超越了常规的离线 RLHF 或静态数据飞轮,引入了 Model-Harness Co-design 和 MindForge 编排的三阶段 RSI(发现-扩展-更新),使得 harness 的能力(如 UI 生成、可执行 REPL)也能随着模型迭代而同步升级。这种闭环让 agent 不再仅仅依赖训练时的分布,而是逐步适应真实世界中的边缘案例,是向“经验智能”迈进的关键一步。

方法

方法总览

Macaron-V1 的方法体系围绕模型-线束协同设计 和递归自改进 两大核心展开,同时依赖于混合LoRA (MoL) 架构实现灵活的任务路由与持续学习。

输入

  • 基础模型:大规模稀疏MoE语言模型(如 GLM-5.2 744B 或 Qwen3.6 50B),在训练阶段保持冻结。
  • 任务定义:通过版本化的线束上下文协议 (HCP) 描述专业能力,如对话、智能体、编码、生成UI等。
  • 经验数据:来自部署环境的交互轨迹,包括用户反馈、世界状态演进、工具调用记录等。

关键模块

1. 混合LoRA (MoL) 路由
  • 采用冻结基础模型 + 可插拔LoRA适配器 的架构,每个适配器针对一个专业任务进行微调。
  • 路由循环:每个用户轮次,系统根据输入上下文和任务类型,从候选集合中动态选择一个LoRA进行前向计算;支持短路(short-circuit)和快速路由,以控制推理开销。
  • KV缓存复用:通过保持每个适配器的独立对话视图(own-view),自然实现跨请求的KV缓存共享;同时探索同请求内路由叠加模式,进一步降低延迟。
  • 部署特性:权重仅驻留必要的LoRA,支持长上下文执行,并通过证据边界验证正确性。
2. 模型-线束协同设计
  • UI4A线束:面向生成式UI的组件原生工具集,使模型能直接输出结构化的界面描述,而非单纯文本。
  • REPL智能体线束:提供可执行代码的沙箱环境,支持组合式工具调用和验证重用,确保生成内容的正确性。
  • 线束上下文协议 (HCP):对所有交互边界(用户输入、工具输出、环境状态)进行版本化契约管理,是持续学习的基础。
  • 实时线束更新:允许线束逻辑在线升级,而不影响已部署的模型,从而支持闭环改进。
3. 递归自改进 (RSI)
  • MindForge框架:协调整个自改进生命周期,包括发现(AutoResearch自动探索弱项)、扩展(生成新的训练数据或适配器候选)和更新(通过强化学习或微调集成新能力)三个阶段。
  • 智能体强化学习:在冻结的稀疏基底模型上,仅对LoRA适配器或策略进行训练,结合LongStraw 响应式长上下文记忆,稳定处理长轨迹。
  • 扩展覆盖率:针对基础模型失败集合,主动构造多样性样本,提升泛化边界。
4. 基础设施支撑
  • MinT平台:管理模型状态沿袭,使每个版本可以追溯其微调数据和评估结果。
  • 稀疏稳定性技术:包括R3(rollout routing replay)对齐推理与训练时的路由分布,IcePop式残差过滤等,解决稀疏MoE模型在RL训练中的rollout-training不匹配问题。

输出

  • 一个能够持续学习、适应新任务并自我提升的开放式智能体系统。各LoRA适配器可独立进化,通过MoL路由无缝协作,实现集体智能 的初步形态。

差异点

与传统的多任务微调或单模型持续学习不同,Macaron-V1通过解耦基础模型与专家适配器、版本化线束协作和自改进循环,首次将开放式持续学习落地于真实环境中,并具备本地部署的 scale-down 能力。

实验

实验设计

Macaron-V1 的实验围绕适应性和协作性两大目标展开。评估覆盖三大类基准:(1) Personal Intelligence 基准:含 Macaron ChatBench(情景对话)和 Macaron LivingBench(动态世界代理任务),通过多层噪声系统模拟真实环境;(2) GenUI 基准:UI4A-Bench 评估生成式 UI 的组件原生能力;(3) 通用能力基准:包括编码、数学、推理等标准测试。对比对象为前沿闭源与开源模型,重点考察 MoL 架构在持续学习和多专家协作上的增益。

关键发现

  1. Mixture-of-LoRA 有效组合专家能力:在冻结的基座上动态选择 LoRA 专家,路由开销极小,且保持每个适配器的独立“视角”正确性,支持 KV 缓存复用,提升推理效率。
  2. 递归自我改进(RSI)循环显著提升代理性能:通过 Model-Harness Co-design,在 UI4A 和 REPL Harness 等工具链中,利用版本化 HCP 协议,实现从部署经验中持续学习,并使用 MindForge 框架编排生命周期。
  3. LongStraw 长上下文 RL 技术:仅使用响应 token 进行长上下文强化学习,解决了稀疏 MoE 基座上的 rollout-training 不匹配问题,增强训练稳定性。
  4. 50B 规模的 Macaron-V1-Tall 在本地部署场景下仍保持竞争力,验证了架构的可伸缩性。

与基线对比

与同类前沿模型相比,Macaron-V1 的核心差异在于架构原生支持持续学习和多专家协作。传统模型微调后易发生灾难性遗忘,而 Macaron-V1 通过冻结基座 + 可插拔 LoRA 专家,实现了能力扩展而不损害原有能力。在代理任务中,其动态重规划和多约束冲突处理能力优于仅依靠单模型记忆的基线。然而,持续学习的累积增益和集体智能的影响仍需进一步探索。

行业影响

落地场景

Macaron-V1 的 Mixture-of-LoRA (MoL) 架构与递归自我改进机制,可适配多种持续进化的 AI 产品:

  • 个人智能助手:融合 chat、agent、coding、GenUI 等多个 LoRA 专家,按需路由,实现跨场景无缝协作,并能从用户交互中持续学习偏好。
  • 生成式 UI 平台:利用 UI4A 组件原生 harness,根据自然语言描述实时生成可交互界面,适用于低代码搭建、电商商品页面动态生成等。
  • 可成长的企业级代理:在客服、代码辅助、数据分析等领域,模型部署后仍可通过 MindForge 框架进行 agentic RL 微调,线上学习新工具和业务规则,避免全量重训。

商业价值

  • 降本:LoRA 适配器仅占极少量参数(相对于 744B 基座),训练与推理成本大幅下降;LongStraw 长上下文 RL 减少了对全量长文本预训练数据的依赖,节省算力。版本化 model-harness 对 让模型迭代可追溯、可回滚,降低运维风险。
  • 增收与体验提升:多专家协作提升任务完成质量,尤其在复杂 agent 场景(如旅行规划、多约束协商)中,准确率与用户满意度较单模型显著提高;GenUI 的即时生成能力可加速产品原型验证与 A/B 测试,缩短上市周期。

与现有产品/工作流的接口

Macaron-V1 基于冻结的稀疏 MoE 基座,LoRA 适配器可像插件一样热加载,与现有推理框架(如 vLLM、TGI)兼容;HCP 合约 定义了 harness 与模型间的标准交互协议,便于接入企业已有的 API 网关、工具集和 RAG 管道。其路由循环可采用短路径优化,不显著增加延迟,能在用户会话级别无缝替换旧模型。

具体落地 use case

  1. 电商智能导购与页面生成:Macaron-V1 的 chat 专家理解用户需求,agent 专家调用商品 API,GenUI 专家动态生成包含图文、评价、比价工具的交互界面。购物助手通过 MindForge 的递归自我改进 从用户反馈中学习,优化推荐逻辑,无需重训基座。
  2. 医疗辅助诊断系统:多个 LoRA 专家分别处理病历摘要、影像报告解读、用药建议,路由模块根据交互意图选择最合适的专家。新诊疗指南或工具可通过新增 LoRA 注入,配合 LongStraw 实现长对话历史的精准引用,确保安全合规。

局限

  • **复合收益尚未验证**:论文明确指出持续学习和集体智能带来的复合收益仍是开放问题。递归自我改进循环依赖版本化的外部评估合同,长期迭代下的能力边界和稳定性未充分探索,且多智能体协作在 MoL 框架下的可扩展性缺乏实证。
  • **架构依赖与泛化风险**:Mixture-of-LoRA 的灵活性受限于冻结基础模型的能力天花板;LoRA 专家间的路由策略仅针对特定基准优化,在面对分布外任务或动态环境时可能出现路由错误或知识冲突。实验主要覆盖个人智能和 GenUI 场景,通用领域泛化证据不足。
  • **工程复杂度与复现门槛高**:系统涉及 MinT 平台、LongStraw 长上下文 RL、稀疏 MoE 稳定性控制等多重基础设施,训练和部署成本显著高于单模型方案。递归自改进的轨迹筛选和上下文学习策略高度精细,公开可复现性存疑。
论文Mind Lab2026-08-10原文

相关内容