行业新闻

港中文与中科大发布VideoCoCo:用代码约束物理视频生成

VideoCoCo用可执行代码搭建物理过程骨架,再让视频模型填细节,使生成画面更符合物理规律。

视频生成常因缺乏物理常识而失真,如黄油不融化、塑料瓶不塌陷。VideoCoCo让AI先写可执行的Blender程序,生成白模视频规定运动过程,再交由生成模型重绘质感。不微调也能提升物理一致性,在PhyGenBench上超过基线模型。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/3f0bd4d3-0200-451d-9d1c-48cc8745a5d3/035(2).jpg) ![图片](/r/blog/3b1171a9ab1a71831b108a9c6abb610eb7a556fe22170b8ca9ef0ccda97f7834.png) 作者介绍 本文第一作者是李浩东,香港中文大学计算机系一年级博士生,曾入选美团 LongCat 北斗计划、腾讯混元青云计划,师从 Prof. Pheng-Ann Heng;本文通讯作者是 Pheng-Ann Heng 教授,香港中文大学卓敏计算机科学与工程学教授,谷歌学术引用量 8 万余次。 让视频看起来真实,不等于让它符合常识 黄油落进热锅后迟迟不化,密封塑料瓶被抽走空气却纹丝不动,干冰在室温中始终保持原样 —— 这些画面单看每一帧或许足够精致,连起来却很容易让人出戏。对影视制作来说,这意味着镜头缺乏可信度;对具身智能和物理仿真来说,问题则更严重,因为模型需要理解的不是像素如何平滑移动,而是事件为什么发生、又将怎样继续。 现有文生视频模型通常从一句高度压缩的提示词直接生成画面。提示词告诉模型 “发生了什么”,却很少交代变化的速度、先后次序、物体之间的作用关系,以及过程结束时应当呈现的状态。模型不得不一边补全这些隐含信息,一边合成视频。香港中文大学与中国科学技术大学的研究团队把这道缺口概括为 “因果不透明性”:人的意图被压缩在短短一句话里,但视频需要展开为完整、连续的时空过程。 VideoCoCo 的切入点由此变得很直接:与其让生成模型在像素空间里凭经验猜测,不如先用一段真正能够运行的代码,把提示词中省略的物理过程写出来,再据此生成视频。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-16原文

相关内容