论文

Combodied Agents: 以人为本的Agentic AI新范式

Combodied Agents: 以人为本的Agentic AI新范式

问题背景:当老年人漏服药物时,软件代理可发送提醒,具身代理可递送药物,但二者均无法解释使用者是遗忘、困惑、出现副作用还是刻意拒绝,也无法提供恰当支持。这揭示了现有Agentic AI的结构性缺陷:数字代理主要转换软件状态,具身代理主要改变物理状态,却都未将人的动态状态与能动性作为建模、干预和评估的首要对象。 方法框架:本文提出 Combodied Agents——一种以人为本的范式,通过软件工具、传感器、可穿戴设备、机器人与人类服务作为行动通道(而非最终目标),对个体随时间变化的状态轨迹进行感知、建模、预测与支持。其闭环流程包括:事件驱动多模态感知重构有意义的事件;纵向可修正记忆提供时间上下文;个人世界模型估计不同决策和干预下的未来状态;合规干预策略在同意、不确定性、安全、可逆性与用户控制约束下选择适度支持。系统不要求构建完整“数字孪生”,而是采用受目的约束、含不确定性、可被用户修正的表示。 设计空间与评估:文章按人体状态目标、关系情境与代理角色组织设计空间,并提出以场景为中心的评估方法、能动性保持指标、基准需求、边缘原生个人模型及治理方向。Combodied Agents将Agentic AI从外部任务完成转向可持续的人类福祉。

论文精读

TL;DR ComBodied Agents 把数字与具身工具纳入闭环,直接建模个人状态轨迹,用事件感知、可纠错记忆、个人世界模型和可接受干预策略实现以人为中心的持续支持,填补 Agentic AI 不把人的状态与 agency 作为核心的结构性空白。

问题

问题背景:当前 Agentic AI 聚焦于自主任务执行,Digital Agents 与 Embodied Agents 分别在软件与物理空间取得进展,但二者缺乏统一的人本视角。

现有方法局限:

  • Digital Agents 主要改变软件状态(日历、消息、API 调用),Embodied Agents 改变物理状态(抓取、导航、递送),两者都以“完成任务”为终点,未将人的持续状态变化作为建模对象。
  • 个人助理、健康代理、AI companion 等能力碎片化,缺乏统一的事件感知、长期可纠错记忆、个人状态预测与干预闭环。
  • 技术缺口具体表现为:事件感知缺少多模态融合与证据重建;记忆无法随时间修正;没有 Personal World Model 来预测未来个人状态和不同干预下的反事实结果;干预策略不考虑同意、不确定性、安全性、可逆性和用户控制。

为什么难/重要:人类状态是高维、非平稳、隐私敏感且难以量化的系统,长期因果推断受干扰因素影响。边缘端个人模型需在低延迟、低功耗下运行,并满足可解释性与可纠错要求。业界对个性化健康、持续照护、自适应人机系统的需求上升,但当前 Agentic AI 容易陷入“过度干预”或“干预不足”:例如老人漏服药物,数字代理只会再发提醒,具身代理只会端水递药,却不知道用户是遗忘、困惑、副作用还是有意拒绝。

行业类比:这类似于自动驾驶需要 world model 预测交通参与者的未来轨迹并采取安全、可逆的驾驶策略;Combodied Agents 将这一闭环从道路转移到人的长期状态轨迹,把软件工具、传感器、机器人和人工服务作为行动通道,而非最终目标。

核心洞察

  • ComBodied Agents 将个体人类状态轨迹设定为系统建模、预测与干预的首要对象,而非让数字或物理动作本身成为终点。现有 Digital Agents 与 Embodied Agents 分别转化软件与物理状态,却都缺失对人的遗忘、困惑、拒绝等状态变化的显式建模,导致支持可能不适当。该范式通过事件感知→纵向可纠正记忆→Personal World Models→可接受干预策略的闭环,把外部任务完成重构为持续人类受益,与任务导向 agent 形成根本差异。
  • 与构建完整 Human Digital Twin 的高门槛路线不同,论文采用 purpose-bounded、uncertainty-aware、user-correctable representations,按具体干预目标构建局部、可修正的个人模型。这既避免全量数字孪生带来的数据成本与隐私风险,又能在边缘端部署轻量个人模型,并通过用户反馈闭环保持透明性与控制力。这种务实设计为后续场景化评测、代理权保留指标及治理方向提供了可落地的工程基础。

方法

输入信号与感知模块

ComBodied Agents 的输入是多源异构数据流:语言/文本、语音/音频、视觉感知、生理生化指标、运动行为、社交关系、环境上下文以及临床结构化记录。系统通过 事件驱动的多模态感知 模块,将这些连续信号融合并重建为有意义的个人事件(如漏服药物、情绪波动、跌倒风险),同时保留 数据质量、来源与不确定性 标签,而非直接丢弃原始证据。

核心处理链路

  1. 纵向可纠正记忆 作为时序上下文存储,记录个体历史状态、事件与用户纠正反馈,支持增量更新与回溯修正。
  2. 个人世界模型 基于记忆与感知结果,预测未来个人状态与可能结局,并可评估不同决策/干预下的反事实轨迹。模型采用 目的有界、不确定性感知、用户可纠正 的表征,避免构建全量数字孪生。
  3. 可采纳干预策略 在获得同意的前提下,考虑不确定性、安全性、可逆性与用户控制权,从软件工具、传感器、可穿戴设备、机器人或人工服务中选择比例适当的行动通道。

输出与闭环

输出 是对个体状态轨迹的持续支持行动,而非单次任务完成。每一次干预后,个人与环境反馈再次进入感知模块,更新记忆与世界模型,形成持续闭环。

与同类工作的关键差异:Digital Agents 仅改变软件状态,Embodied Agents 仅改变物理状态;ComBodied Agents 将 个体的动态状态与自主性 作为建模、干预与评估的第一对象,外部工具只是实现人类福祉的通道。

实验

实验设计:本文为概念综述与框架论文,未报告传统定量实验。作者提出场景为中心的评价(scenario-centered evaluation)与代理保护指标(agency-preservation metrics),并规划构建 CombodiedBench 基准。设计逻辑以个人状态轨迹建模为核心,覆盖事件感知、长期记忆、个人世界模型与干预策略。

关键发现:现有基准(GSM8K、MMLU 等)衡量离散任务完成度,无法评估对个人长期福祉的影响。作者强调需要从外部任务完成转向持续的人类获益,指出 Digital Agents 仅转换软件状态、Embodied Agents 仅转换物理状态,二者均未将人的演进状态和能动性作为首要建模对象。

基线对比解读:相较于单一数字代理或具身代理,Combodied Agents 将感知、预测、干预形成闭环,并引入可纠正的长期记忆与个人世界模型。该范式不依赖全量人类数字孪生,而使用目的受限、不确定性感知的表示,在伦理与工程可行性上更务实。

行业影响

落地场景

ComBodied Agents 适用于需要长期追踪个人状态并适时干预的场景。医疗健康中,可部署为慢病管理助手:整合可穿戴设备、用药记录、语音交互,感知患者状态轨迹,预测恶化风险并触发个性化提醒或联系照护者。企业服务中,作为员工福祉系统,融合日程、键盘交互、生理信号,识别认知过载并建议休息或调整任务。

商业价值

主要价值在体验提升与降本。对医疗服务提供方,减少可预防的急诊与再入院,降低照护人力成本;对消费级产品,从“被动工具”升级为“主动陪伴”,提高付费留存。B2B 场景中,可打包为健康管理 SaaS 订阅,形成新收入线。长期通过代理性干预减少无效沟通,提升用户满意度。

与现有产品/工作流接口

Combodied Agent 可作为中间层集成进现有 stack。数据层对接 Apple HealthKit、Google Fit、企业 EHR API 等;推理层复用云端 LLM 的同时,在边缘设备部署小型个性化模型(如量化 LoRA 适配器)。输出通过标准 FHIR 或 webhook 与 CRM、任务管理系统交互。无需替换现有基础设施,先以“旁路建议”模式运行,逐步获得用户信任后提升干预强度。

具体 use case:

  • 远程医疗平台:整合患者可穿戴数据与电子病历,Combodied Agent 检测到心衰患者体重短期上升(提示液体潴留),自动调整利尿剂提醒并通知护士团队。
  • 智能办公协作工具:结合键盘活动、会议密度与可穿戴压力指标,识别员工临近 burnout,建议重新排期非紧急会议并推送放松资源,同时保留用户拒绝权。

局限

  • **缺乏实证验证** 是本框架的主要局限。论文作为概念性范式文章,未提供任何实现细节、原型系统或实验数据,无法验证 **Personal World Model** 的预测能力、**admissible intervention policy** 的安全性以及整个闭环的长期收益。作者虽提出 **CombodiedBench** 等评估设想,但基准尚未构建,导致无法与现有 Human-in-the-loop Agent、Digital Twin 等方法进行定量比较,实际工程落地难度较大。
  • **隐私、同意与边缘治理** 构成核心挑战。框架依赖事件级多模态感知和长期可纠正记忆,持续采集健康、行为、社交等高度敏感数据,这在真实部署中需要严格的用户控制、可撤销同意、数据最小化和边缘存储安全。论文在风险章节虽讨论治理方向,但未给出具体技术方案,例如差分隐私、联邦学习或可信执行环境的集成方式,这使得 Combodied Agents 在医疗、养老等高合规场景中缺乏可操作的安全设计。
  • **个人世界模型的建模可行性** 被过度假设。跨时间因果推断、反事实预测和个体化适应需要大量高质量纵向数据,但当前 LLM 与边缘模型在持续学习、不确定性量化和长期记忆一致性方面仍然薄弱。论文提出的三层演进路径(Cloud-Centric、Hybrid、Edge-Native)虽然清晰,但边缘本地模型的推理能力、存储容量和能耗限制可能使 Stage III 难以在短期内实现,导致整体框架停留在愿景层面。
论文Qianggang Ding2026-08-11原文

相关内容