它石智航发布具身原生大脑AWE 3.5,多模态模型实现自闭环学习
它石智航的AWE 3.5模型让机器人通过内部想象模拟世界,减少真实物理试错,大幅降低数据需求,推动具身智能工业化落地。
它石智航在WAIC展示了AWE 3.5模型,从预训练就融合视觉、语言、动作等多模态,能同时预测和行动,在模型内部模拟物理交互,无需外部仿真器。新任务只需小时级数据采集,已在汽车线束装配等多个工业场景验证。
正文摘录
2026年 WAIC,它石智航把一条 1:1 还原的环形线束流水线,搬进了展馆。多台机器人集群合作,流水线轮转线束板,每个工位同一时间装配不同的线束线型。 它石给新版本取名 3.5,信号也挺明确的:希望它像 GPT-3.5 一样,在多任务能力上开始展现新的可能。 到了 3.5,模型开始向更多场景溢出。工业装配、插接、收纳……全部被放进同一个模型里。 今年它石 WAIC 展台的主题-打造可信赖的物理 AI,也是围绕这项特点展开,任务之间不重新加载新的模型,不切换参数,全靠同一个基础模型。 现场的展示非常魔幻,他们的机器人简直是「劳模」,整理桌面、打包手机、插网线、零件分拣……反正不管啥东西,递过去就开干。 你捏起一块积木,松手,积木像受重力一样落向桌面。你拖拽手机盒,盒子产生对应的位移和摩擦。蜡烛上微弱的火焰,也在模型中被忠实地呈现出来。 这些交互没有一行牛顿定律代码,没有碰撞引擎,没有物理结算。所有重力、柔性、碰撞反馈、物体位移……全部,由模型从真实类数据中学到。 为此,AWE 3.5 依托 human-centric 数据专门强化了模型结构,让它显式学习长时记忆和长时序空间理解,在数分钟的连续、交互闭环推演中保持环境稳定。在此基础上,后训练可以从连续过程中切出多个动作片段,而不用担心环境在下一秒崩掉。 今年以来,行业一直有 VLA or 世界模型的争议,但最近和很多做具身的朋友聊了后发现,真正训模型的人根本不在乎所谓路线之争。 VLA 架构里,视觉和语言在预训练阶段就紧密耦合,动作模态却要到后训练才通过 SFT 接入。这相当于一个学生先学了全部理论课,临考试前才开始动手做实验。理论和实操之间,隔着一道先天的裂缝。 世界模型路线往前走了一步,至少可以利用大规模视频学习表征能力。