基础模型时代的人类中心智能:综述
人类中心智能正处在基础模型时代的变革之中,日益强调规模、可迁移性和通用建模能力。然而,人类中心智能尚未与基础模型深度结合,未取得可与后者媲美的进展。更重要的是,该领域近年涌现的先进成果在任务、模态和研究社区之间仍显割裂,其内在的概念与方法论联系尚不清晰。为弥合这些鸿沟并重新审视基础模型时代的人类中心智能,我们提出了一种全谱系人类上下文分类法,通过视觉外观和空间几何将人类视为可观察主体,通过运动动力学和交互建模视为动态行动者,并通过世界模拟和具身代理视为情境智能体,由此整合六个相互关联的层面。 我们首先介绍该领域的方法论基础,涵盖人类中心数据族、计算架构范式以及代表性的训练与推理优化策略。随后,我们系统回顾了各层面的代表性方法,并整理了相关数据集、基准和评估指标。最后,我们讨论了迈向可扩展、可信、物理可落地的人类中心智能所面临的开放挑战与有前景的研究方向,旨在为该领域的发展提供统一框架和实践参考。此外,我们在项目页面上系统整理并持续更新人类中心AI文献与资源。
论文精读
TL;DR 这篇综述提出全谱系人类情境分类法,将人类视为可观测主体、动态行动者、情境化智能体六个层级,系统梳理数据、架构、优化与评测,为统一人类中心基础模型提供路线图。
问题
问题背景
当前 人本智能(human-centric intelligence)在 基础模型 时代强调规模、迁移与通用建模,但尚未像视觉 / 语言领域那样深度整合基础模型范式。领域内关注从视觉外观、空间几何到运动动力学、交互建模,再到世界模拟与具身代理的全谱系能力。
现有方法局限
多数工作分散在不同任务、模态和社区,缺乏统一的 human context taxonomy 与跨层级共享表示。具体表现:
- 模型针对单一层级设计,如仅处理像素级外观或关节级运动,特征空间互不兼容,难以在全身交互等复合任务中迁移。
- 数据与评测割裂,无法利用大规模预训练;架构上多为 单步映射 或 序列分解,缺少 迭代生成 与物理约束的混合设计。
- 优化策略少有同时兼顾训练效率与推理延迟,如 LoRA 等轻量适配尚未系统应用于人本任务。
为什么这个问题难 / 重要
人类是高度复杂、多尺度、动态且与环境强耦合的主体,需要同时处理像素信息、三维结构、关节动力、接触物理、社交意图与具身行动,任何单一模态任务都不足。基础模型虽具强大先验,但如何注入 物理一致性 和 可交互性 仍是开放难题;数据隐私、标注成本与评测泛化进一步制约进展。业界关注数字人、人机交互、机器人学习与 AR/VR 等应用,亟需可扩展、可信且可部署的人本模型。
行业类比
类似于自动驾驶从单模块感知演进到端到端世界模型,人本智能需要从分散任务走向统一的物理接轨基础模型,以支撑通用 assistant 或 embodied agent 落地。
核心洞察
- 该综述提出全谱系人类上下文分类法,将人类中心智能从视觉外观、空间几何、运动动力学、交互建模到世界模拟、具身智能体六个层次统一起来,形成从感知到行动的连贯框架。 与以往各自独立的人类解析、动作识别、人机交互研究不同,此分类法揭示了跨任务的概念联系,为不同模态和社区提供共同语言,有助于模型复用与跨层次迁移,对设计统一人类中心基础模型具有架构指导意义。
- 综述系统梳理了人类中心数据家族(视觉、空间结构、感觉运动、无线测距、语言声学)、计算架构范式(单步映射、序列分解、迭代生成、混合)及训练推理优化策略,指出当前人类中心智能尚未充分受益于基础模型的规模化与通用性。 这一方法论整合为构建可扩展、可迁移的人类中心基础模型提供了工程蓝图,并为如何在有限人类标注数据下利用预训练基础模型进行高效适配给出了具体技术路径。
方法
统一分类法框架
该综述提出一种以人类上下文为轴心的六层分类法,将人视作三类角色:
- 可观察主体:聚焦视觉外观(如人体解析、身份识别)与空间几何(如姿态估计、形状重建)。
- 动态演员:关注运动学动力学(动作生成、视频驱动)与交互建模(人物交互、场景交互、社交交互)。
- 情境代理:涵盖世界模拟(以人为中心的世界生成、可操作规划)与具身代理(通用人形控制、技能迁移)。
方法论基础
- 数据家族:整合视觉成像、空间结构、感觉运动、无线测距、语言声学五类信号,覆盖从静态表观到动态交互的完整数据谱。
- 计算架构:按任务性质分为单步映射(端到端回归)、顺序分解(分阶段估计)、迭代生成(扩散/自回归式生成)、混合架构(多路径融合)。
- 优化策略:训练侧包括多任务预训练、对比学习、弱监督适配;推理侧强调模型蒸馏、动态计算图、量化部署。
输出与差异
该方法框架输出一个可扩展的组织体系,将独立任务归类于同一上下文层级,从而识别跨层共性(如外观→运动→交互的级联关系)。与以往按视觉/语言/机器人割裂的综述不同,本文以人类认知层次为主线索,连接基础模型时代的通用表征与具身智能,为构建统一人本基础模型提供理论脚手架。
实验
实验设计
本文为综述,没有独立实验,而是以 六层 Human Context Taxonomy(Observable Subjects / Dynamic Actors / Situated Agents)为主线,系统梳理了人类中心数据的信号家族、四类计算架构以及训练与推理优化策略,并覆盖视觉外观、空间几何、运动动力学、交互建模、世界模拟、具身智能等任务。
关键发现
- 当前 human-centric AI 研究分散在任务、模态和社区之间,缺少统一框架;本综述提出全谱系分类法整合视觉、动态和具身三个视角。
- 基础模型方法尚未充分渗透到 human-centric 领域,尤其在运动建模、交互和世界模拟方面存在明显断层。
- 文章整理了相关数据集、基准和评估指标,并指出开放挑战:可扩展可信数据、统一基础模型、物理接地、世界模型与具身智能、泛化评估、高效部署。
与基线对比的解读
与以往单任务人类建模综述相比,本文不是方法罗列,而是提供概念与方法论框架,将 单步映射、序列分解、迭代生成、混合架构 等范式统一起来。这为工程实践提供了选型参考:例如需要高精度几何重建时可优先考虑迭代生成架构,实时部署则关注单步映射与推理优化。但作为综述,没有定量对比,需结合原始论文具体指标。
行业影响
落地场景
- 电商虚拟试穿与数字人直播:利用视觉外观与空间几何层,生成可控服装上身效果与虚拟主播动作,减少实拍成本,提升 SKU 覆盖速度。
- 内容平台创作者工具:运动动力学与交互建模可将单张照片转化为跳舞 / 讲解动画,支撑 UGC 短视频批量生产。
- 具身智能与自动驾驶仿真:世界模拟与具身智能层可合成行人互动、人机协作场景,用于机器人策略训练与安全验证。
商业价值
主要走降本 与体验提升 两条线:
- 降本:合成数据替代真人实拍和动捕,减少标注与制作费用;自动化数字人客服延长服务时间。
- 增收:虚拟试穿降低退货率,个性化形象提升转化;短视频工具增加创作者付费订阅。
- 体验:实时姿态驱动和物理真实感优化远程协作、虚拟会议等场景。
与现有产品 / 工作流接口
- 中间表示标准化:采用 SMPL/FLAME 等参数化人体模型作为视觉、语言、控制模块的交换格式,避免各团队重复造轮子。
- 适配器微调:在 vision-language foundation model 上添加人体感知 / 生成适配头,无需全量重训,降低算力门槛。
- 推理优化部署:利用论文中的序列分解、量化和蒸馏策略,将人体理解模块压缩为边缘可运行服务,通过 gRPC 或 REST 输出结构化人体状态(关键点、mesh、动作标签),供业务中台调用。
- 数据闭环:生成式数据增强与仿真回放持续注入训练集群,提升长尾场景覆盖。
局限
- 论文承认 human-centric intelligence 尚未与 foundation models 充分整合,跨任务、模态、研究社区的进展碎片化,缺乏内在概念和方法连接。本文提出的 full-spectrum human context taxonomy 虽然提供了一个统一框架,但本质上是一个分类和综述工具,并未给出可实际运行的 unified model 或具体实现方案。这种框架级贡献难以直接指导算法落地,更多是帮助研究者梳理领域边界,其有效性依赖后续工作验证。
- 本文是 survey,没有进行任何实验或提出新方法、新架构,因此无法通过定量指标衡量其贡献。覆盖 six interconnected levels 必然导致每个 level 的综述深度受限,例如 visual appearance 与 spatial geometry 的最新 generative models 或 motion modeling 中的 diffusion-based 方法可能未能深入比较。同时,对 training/inference optimization 的讨论停留在 paradigm 层面,缺少具体的 loss、scheduler、sampler 等工程细节。
- 与已有的 human-centric AI 综述相比,本文的 taxonomy 虽更具系统性,但项目资源库 [GitHub](https://github.com/cseeyangchen/Human-Centric-AI) 目前仅有 12 stars,可见社区影响力和持续维护能力尚未得到验证。此外,综述中引用的部分工作可能在 2026 年已显滞后,而 human-centric embodied AI 和 world models 领域迭代极快,静态综述的时效性不足。