行业新闻

清华港科大提出LiveEdit:4步去噪实现12.66 FPS实时视频编辑

清华港科大用因果注意力加缓存,将视频编辑提速到实时,可用于直播等场景。

LiveEdit 是清华和港科大提出的实时流式视频编辑框架,用因果分块处理持续视频。它通过三阶段蒸馏把推理步数从100压缩到4,并利用掩码缓存跳过未编辑区域的计算,实现了12.66 FPS的速度,同时保持编辑准确性和背景一致。

正文摘录

翻译后的 markdown 正文如下: ![](https://image.jiqizhixin.com/uploads/article/coverimage/01d0bad8-a413-4517-873d-bf903a28544e/058(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 文本指令驱动的视频编辑技术正在从离线内容生产走向直播特效、视频会议和增强现实等在线交互场景。 然而,高质量的视频扩散模型 通常依赖于对完整视频进行双向时空注意力处理,即模型需要等待未来帧到齐,再对整段视频进行联合处理。这种范式能够获得较好的编辑结果,却难以满足低延迟、持续输入与即时输出的要求。 近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步/视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-01原文

相关内容