动态

Seedance 2和Sora用LLM转写prompt,视频模型能力持续提升

Andrew Curran
Seedance 2 令所有人印象深刻的原因之一在于,它完成了与 Sora 相同的事情:从极其简单的提示词生成非常详细的视频。事实上,大多数走红的 Seedance 片段都是基于一两句话的提示生成的。

我们始终未能确切了解 Sora 的内部机制。@tbpn 在 Sam 和 Jackub 做客时曾问及此事(谢谢你们),但他们选择不具体回答。这可以理解。

对于 Seedance 2,我们还没有论文,但 Seedance 1 的论文已经发布,其中提到他们确实使用 LLM 将用户提示转换为信息密度更高、结构更严谨的提示风格,视频模型正是基于这种风格训练的。他们用 Qwen 来完成这项工作。这正是我们大多数人猜测 Sora 所采用的方式:可能是一个专为此任务微调的 GPT-5 版本,在重写我们的提示并添加细节。标准 5.x 版开箱即用就已经很擅长这件事了,所以实际上甚至不需要微调。如果 Sora 真的是这样工作的,那么一切就都说得通了。

这意味着,对于选择这条路径的实验室而言,保持竞争力还将取决于子导演模型,以及它们在用户给出的故事骨架基础上进行扩展的能力。为 Sora 执行此任务的模型在场景设定、背景知识、服装乃至角色的口音和举止等所有方面都知识渊博。对于大多数设定,其了解程度达到粉丝维基级别。该模型也非常擅长从文本中解读用户意图——所有 5 系列模型都擅长此道。有趣的是(之前这点有些不寻常),这个模型也乐于主动出手,例如即兴创作对话、编写插曲音乐和歌词,或者如果它认为合适并能提升作品,就会添加跳接剪辑。Seedance 也做同样的事情。我想这都是能力进步的一部分——模型推断理想场景中应该发生的事情。最终这将更多基于模型对用户的理解,而非当前这样。

大实验室面临的问题是,这种神奇体验的一部分来自于能够即时使用任意角色和任意设定的组合。视频模型对过去五十年银幕上出现过的每一个演员都了如指掌。对于任何流行角色,它们熟知每个细微差别,并能将其置于任何设定中,说出或做出任何事。Sora 在发布周就是如此。这种能力已经存在。Sam Altman 在 Sora 发布时公开自己平台上的图像,部分原因就是为了让人们准备好面对这样的事情最终会发生在每个人身上。但如果只有一方能够用现代小说中的每个角色做到这一点,那就不太公平了。无论版权问题如何发展,承诺的创意自由视频引擎似乎确定将在今年到来。比预期更快,但视频模型在过去两年里进步速度已经超过语言模型。而且就像其他一切一样,它似乎还在加速。
Andrew Curran
如果你从未使用过视频模型,那么几乎总有一个隐藏的语言模型作为链条的中间环节,传递你的提示。这样做有很多原因。这也是你第一次遇到内容拒绝的检查点。

这第三个模型将会
动态Andrew Curran2026-02-14原文

相关内容