Kairos: 面向物理AI的原生世界模型栈
世界模型正从被动视觉生成器转变为物理AI的基础操作基础设施:它们必须原生地从异构经验中获取世界知识,在长时间范围内维护持久状态,并在实际部署约束下高效执行。 我们提出 Kairos,一个围绕这些需求设计的原生世界模型栈: 1. 原生预训练范式 由 跨本体数据课程 主导,将开放世界视频、人类行为数据和机器人交互组织成渐进发展路径。 2. 原生统一架构 配备 混合线性时间注意力,其中 滑窗注意力 捕获局部动力学,膨胀滑窗 捕获中程依赖,门控线性注意力 维护持久全局记忆。我们建立理论边界,证明 时间分解 严格限制 误差累积,保证状态传播。 3. 部署感知的系统协同设计 支持在服务器和消费级硬件上进行低延迟展开生成,用于真实世界的观察-行动-反馈循环。 在 具身世界模型、长时间范围基准 和 行动策略基准 上的实验表明,Kairos 在提供强大效率-性能权衡的同时实现了顶级性能,定位为未来自我演化物理智能的连贯操作基础。
论文精读
TL;DR Kairos 是原生世界模型栈,以跨具身数据课程预训练、混合线性时间注意力和误差界保证,赋予物理AI长期状态维持与高效部署推演能力。
问题
问题背景
世界模型正从被动视频生成器转型为物理 AI 的操作基础,要求模型天然地从异构经验中获取世界知识、在长时间尺度维持持续状态,并在真实部署约束下高效运行。当前领域聚焦于如何构建能够支撑具身智能自主决策与长期推理的世界模型。
现有方法局限
现有世界模型主要基于视频生成扩散模型,存在三大技术局限:
- 数据模态单一:多数模型仅从固定视角视频学习,缺乏跨具身(cross-embodiment)数据的结构化课程,难以泛化到机器人与人类的交互行为。如 UniSim 等模型未利用人类运动数据与机器人操作的共同结构。
- 时序架构薄弱:标准 Transformer 的二次复杂度注意力或常规线性注意力,要么无法捕获多尺度依赖(局部动态、中程关联、全局记忆),要么缺乏对长期误差累积的理论控制,导致预测在数十步后发散。
- 推理部署割裂:高强度扩散采样与云-端异构硬件脱节,缺乏面向实时观测-行动回路的延迟优化,难以满足物理 AI 对低延迟回滚的需求。
问题的难度与重要性
该问题的挑战在于:误差累积的指数增长是长期预测的内在数学障碍,需要从理论层面构建具备可控误差界的时序分解。同时,统一理解、生成与预测的架构需要同时兼顾表示学习与生成任务,并平衡全局记忆力与局部细节。随着具身智能、人形机器人和自动驾驶等应用兴起,工业界迫切需要世界模型作为物理推理的“模拟器”,其效果直接影响策略学习与安全性评估。
行业类比
如同大语言模型的“系统 2”推理需要世界模型作为心智模拟,物理 AI 的世界模型相当于机器人的“想象引擎”:必须快速、准确地在思维中预演动作后果,否则无法在真实世界中闭环工作。
核心洞察
- **混合线性时间注意力通过理论误差界限保证长期状态持久性**: Kairos 的 Hybrid Linear Temporal Attention 将滑动窗口、扩张窗口与门控线性注意力结合,并给出了形式化的误差积累上界。相比纯滑动窗口或普通线性注意力,这种时域因式分解在数学上严格限制了多尺度记忆的漂移,确保在数千步的规划与生成中状态传播的可靠性,直接回应了 Physical AI 对长期稳定性的核心需求。
- **跨具身数据课程为世界模型提供了从被动生成到主动推理的发育路径**: Kairos 的 Native Pre-training Paradigm 通过 Cross-Embodiment Data Curriculum 将开放视频、人类行为数据与机器人交互组织成渐进预训练管线。这不同于大多只利用仿真或固定任务数据的做法,使模型能够在广泛的具身经验中习得普适世界知识,进而统一理解、生成与预测,为通用 Physical AI 的自我演进奠定了基础。
- **部署感知系统联合设计让世界模型从云端延伸至端侧实时闭环**: Kairos 采用 Deployment-Aware System Co-Design,结合 Timestep Distillation 与硬件感知优化,同时追求云端的低延迟与消费级设备的成本效率。相比仅关注离线精度的工作,这种设计使世界模型可作为在线观察‑行动‑反馈回路的核心引擎,为真实场景中的物理交互提供即时世界模拟。
方法
Kairos 的方法核心围绕原生预训练范式与混合线性注意力架构构建世界模型,按“多源数据输入 → 分阶段课程学习 → 统一架构理解/生成/预测 → 低延迟 rollout 输出”流程运作。
输入与预训练课程
输入为跨具身数据:开放世界视频、人类行为记录及机器人交互轨迹,经跨具身数据课程组织成渐进预训练路径。
- 阶段一:物理预训练 – 从大规模开放视频中学习通用物理规律与视觉先验。
- 阶段二:具身预训练 – 引入人类中心数据,建立交互本体感知。
- 阶段三:联合世界-行动训练 – 融合机器人操作数据,同步学习世界状态演变与动作策略。
原生统一架构
模型采用原生统一架构,将世界理解、视频生成与未来预测统一于一个扩散 Transformer。其核心是高效扩散 Transformer 结合混合线性注意力:
- 长期记忆:门控线性注意力 – 配备门控 delta 更新机制,通过线性复杂度维护持久全局状态,理论保证误差有限。
- 中程依赖:膨胀滑动窗口注意力 – 在常规滑动窗口基础上引入空洞(dilation),以较低成本扩大感受野,捕捉中期时序结构。
- 局部动态:滑动窗口注意力 – 标准窗口注意力捕获短距离高频变化。 三者通过时序分解形式融合,数学上证明误差累积被严格限制,从而支持极长时域的状态传播。
推理与部署协同设计
面向物理 AI 的实际部署需求,Kairos 引入时间步蒸馏压缩扩散采样步数,并结合硬件感知优化,使服务器与消费级 GPU 均可实现低延迟、高吞吐的 rollout 生成。推理阶段还包含自进化与提示自对齐机制,允许在线适应新场景。
与传统的通用视频生成世界模型不同,Kairos 并非简单扩大模型规模,而是通过原生预训练课程与混合尺度时序注意力的协同,在长时一致性、跨具身泛化和实时推理效率之间取得平衡,为物理 AI 提供可部署的操作基础。
实验
实验设计
Kairos 在三个核心维度上进行验证:具身世界模型基准(Embodied World Model Benchmarks)评估视频预测质量与状态保持能力;世界动作模型基准(World Action Model Benchmarks)测试依据观测预测动作的能力;长程生成(Long-horizon Generation)考察跨越数百步的时序一致性。消融实验逐一分析 跨具身数据课程(Cross-Embodiment Data Curriculum)、混合线性注意力(Hybrid Linear Attention)模块与推理优化策略的贡献。效率实验展示在云端与消费级硬件上的部署表现。
关键发现
- Kairos 在所有基准上达到领先水平,尤其在长程场景下,其 混合线性时间注意力 有效遏制误差累积,理论分析了全局记忆误差界与长程超额风险界。
- 跨具身数据课程 使模型从开放世界视频渐进学习至机器人交互,显著提升下游任务泛化性。
- 部署协同设计 通过时间步蒸馏和硬件感知优化,在服务器和消费级 GPU 上实现低延迟 rollout 生成,赋予物理 AI 闭环响应能力。
基线对比解读
相比纯滑动窗口或纯线性注意力世界模型,Kairos 的 膨胀滑动窗口 捕获中程依赖,门控线性注意力 维持持久全局记忆,这一多尺度分解在理论保证下更稳定。在动作策略评估中,联合世界-动作训练(Joint World-Action Training)带来的具身对齐优于独立视觉预训练。整体上,Kairos 在能力-效率 trade-off 上取得优势,为自进化物理智能提供了可运作的基础框架。
行业影响
落地场景
Kairos 作为原生物理世界模型栈,可直接融入具身智能仿真、自动驾驶闭环训练、工业数字孪生与 AR/VR 内容生成。例如:
- 仓储机器人:基于 Kairos 的跨具身预训练与长时状态保持能力,可以在虚拟环境中批量生成物体搬运、避障、协作等场景,用于策略预训练与 Sim2Real 迁移。
- 自动驾驶:利用其统一理解-生成-预测架构,实现路网、动态目标与自车行为的联合建模,支撑长时决策规划与 corner-case 生成。
- 内容平台:物理交互短视频或游戏引擎,可生成符合现实物理规律的动态内容,提升沉浸感。
商业价值
- 降本:大幅减少真实环境数据采集与设备损耗。混合时态注意力严格限制了长时推演误差,使仿真可以直接替代部分实物测试,降低 GPU 集群迭代成本。
- 增收 / 体验突破:产品化后,机器人公司可为客户提供更快的技能部署与更低的故障率;仿真平台可提供高保真场景库订阅服务。AR/VR 应用可产生更自然的手势/物体交互,提升用户付费意愿。
- 效率提升:部署感知系统协同设计支持服务器与消费级 GPU 的低延迟 rollout,使移动端/边缘端物理 AI 产品成为可能,缩短从训练到实机的反馈闭环。
与现有工作流的接口
Kairos 设计为模块化栈,可通过以下方式嵌入现有工具链:
- 数据层:兼容开源视频、人类行为与机器人数据,可与现有数据湖(如 HuggingFace Datasets)对接,利用其跨具身课程学习管道自动编排。
- 模型层:统一架构输出视频、状态与动作,可替代传统分立的视频预测模型与策略网络,通过 ONNX/TensorRT 导出与 ROS 2 节点或推理服务器(如 Triton)集成。
- 硬件层:提供硬件感知推理优化配置,支持 NVIDIA 等生态,企业可直接在现有仿真平台(如 Isaac Sim)调用 Kairos 作为生成式世界引擎,亦可通过 REST API 供云服务调用。
典型 Use Case
- 电商仓储拣选:用 Kairos 在虚拟环境中生成海量光照、遮挡、堆叠变化的抓取场景,训练通用抓取策略,再微调后部署至真实机械臂,将策略开发周期从周级缩短至天级。
- 自动驾驶长尾场景生成:基于 Kairos 的全局持久记忆,输入“夜间暴雨,前方有故障车”等文本,生成多视角连贯视频并输出未来轨迹,直接注入感知-规划联合训练管道,提升模型对罕见场景的覆盖率。
局限
- - **理论误差界对假设敏感**:论文为混合时间注意力推导了误差累积上界,但基于平稳性、独立噪声等理想假设,实际物理交互中非平稳分布与耦合噪声可能导致误差增长快于理论预期,长程状态传播的可靠性仍需在更随机、对抗性环境中验证。
- - **跨具身泛化边界不清**:Native Pre-training Paradigm 通过课程学习融合多种具身数据,但实验未系统性评估对全新形态(如无人机、水下机器人)的零样本迁移能力,可能存在对训练具身分布的过拟合,且大规模行为数据采集的成本与隐私限制可能阻碍课程扩展至更多场景。
- - **部署效率与生成质量的权衡**:Deployment-Aware Co-Design 虽针对云端与消费级硬件进行了优化,但在严格资源受限的边缘设备(如嵌入式 NPU)上,Timestep Distillation 等加速策略可能降低长时域生成的时间一致性,且当前设计未充分量化能效比,限制了其在移动机器人等平台上的实用性。