Vivix 发布实时互动模型 A1,单卡推理超万 video tokens
Vivix A1 通过流式架构与高效推理优化,首次在消费级显卡上实现近30B参数模型的实时多模态交互视频生成。
Vivix A1 是全球首个统一多模态参考、实时交互与流式生成的原生流式模型。采用多维联合蒸馏将视频扩散从8步压缩到2步,联合原生NVFP4训推与计算-通信协同调度,在消费级显卡上实现近30B参数模型实时推理,延迟低至0.6秒,单卡吞吐超万 token。
正文摘录
单卡突破 10000 video tokens/s,Vivix 打通实时多模态生成全链路 而今天,AI 已经能“附”到任何物体或角色身上,让它们在另一个世界里开口、行动,和你实时视频通话。 比如,这只小猫可以一边说着土味情话,一边弓背、摇尾巴、抬爪子,还能在自己的世界里来回走动(注意看,它脚下的影子也会随之变化)。 屏幕里的角色真正拥有了身体。它不再只是对着镜头说话,而是能够行动、转身、改变姿态,并与所在世界里的物体和环境持续互动。 W1 让用户不再只是站在屏幕外看故事,而是可以随时介入,改变人物的选择、行动,以及接下来的剧情走向。 但据 Vivix 官网技术博客介绍,A1 虽然拥有近 30B 激活参数,却通过 MJD、原生 NVFP4 训推策略和一套自研的通信-计算调度 + mega-kernel 推理基础设施,将部署门槛极致地压到了消费级 GPU 实时推理,近似画质下推理效率提升了近两个数量级。 与此同时,其流式调度器响应新输入的时间最短为 300 毫秒,从用户发出输入,到画面首次出现可见反应,延迟平均 0.6 秒。 官方现已开放内测,欢迎访问官网及 API 开放平台申请体验:https://vivix.ai/ 这通平行世界的视频电话要真正接通,第一步不是让角色回答得多聪明,而是让它在持续生成过程中,始终还是同一个角色、身处同一个世界。 Vivix 将 A1 定位为全球首个在一套原生流式架构中,统一 多模态参考 、 实时交互 和 流式生成 的基础模型。 为了实现上面的效果,A1 首先把多模态参考、实时交互和视频生成,统一进了一套原生流式架构。 模型既要随时响应用户的新输入,又要在不断向前生成的过程中,维持角色、物体和场景的长期一致性。