行业新闻

南京大学等开源全栈视频理解大模型 VideoChat3

VideoChat3 以 4B 参数实现高性价比的视频理解,并全栈开源,推动社区生态。

VideoChat3 是一个 4B 参数的多模态大模型,专门用于视频理解。它用 I3D-ViT(一种将时序建模前移到视觉编码的架构)实现原生时空建模,并通过自适应帧分辨率机制动态分配计算资源,从而高效处理短视频、长视频和实时视频流。模型、代码和数据全部开源。

正文摘录

打通感知-理解-交互链路,全栈视频理解大模型 VideoChat3 开源了 - 来源:机器之心 ![](https://image.jiqizhixin.com/uploads/article/coverimage/f6e6e332-be75-4567-8f7d-c71f903636f1/014(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 视频是描述物理世界的重要数据形态,更是人类与物理世界交互的重要载体,视频理解大模型是让 AI 从数字世界走向物理世界最基础、最原生的组成部分。面向物理世界的视频智能,难点早已不只是 “看懂一段短片”,而是需要看清细微的动作,处理小时级的长程信息,还能应对持续到来的实时视频流;它不仅要回答 “发生了什么”,还要判断 “证据出现在哪里” 与 “什么时候应该回应”。 与此同时,海量视频帧带来的视觉 token 会随时长快速增长,模型的训练与推理成本也随之攀升。有没有可能用一个高效模型,同时兼顾短视频、长视频和在线视频理解? 近日,南京大学、上海人工智能实验室、南洋理工大学和北京大学的研究团队发布了 VideoChat3 。这是一个面向通用视频理解的 4B 参数多模态大模型。围绕 “全面、高效、开源” 三个目标,研究团队从视觉编码器架构、流式感知机制和训练数据体系三个层面进行系统设计。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-22原文

相关内容