动态

Veo 3视频生成的宏观影响与直接优化潜力

Andrej Karpathy
Veo 3 给我留下了深刻印象,还有人们在 r/aivideo 等地方发现的所有东西。添加音频后,质量上有了很大提升。

视频生成有一些宏观方面可能尚未被充分认识:

1. 视频是大脑最高带宽的输入。不仅用于娱乐,也用于工作/学习——想想图表、动画等。
2. 视频是最轻松/有趣的。普通人不喜欢阅读/写作,这很费力。任何人都可以(并且想要)参与视频。
3. 创建视频的障碍趋近于 0。
4. 视频首次可以直接优化。

我需要再强调/解释一下第 4 点的重要性。直到现在,视频一直围绕着索引、排序和提供有限的候选集(由人类昂贵地创建)。如果你是 TikTok,想要保持一个人的注意力,关键在于让创作者制作视频,然后找出将哪个视频呈现给哪个人。总的来说,“人类创作者学习人们喜欢什么,然后排序算法学习如何最好地向某人展示视频”这个系统是一个非常非常差的优化器。好吧,人们已经沉迷于 TikTok,所以显然它相当不错,但我认为它远未达到理论上可能的水平。

来自 Veo 3 及其同类的视频是神经网络的输出。这是一个可微的过程。因此,你现在可以接受任意目标,并用梯度下降法彻底优化。我预计这个优化器将比我们目前看到的强大得多。即使是简单的通过人类或 AI 迭代、离散地优化提示(保持参数不变)的过程,也可能是一个足够强大的优化器。所以,现在我们可以以用户参与度(或瞳孔扩张等)为目标,直接针对生成的视频进行优化。或者以广告点击转化率为目标,直接进行优化。

为什么要在有限的视频集中做索引,当你可以无限生成视频并直接优化它们时?

我认为视频有潜力成为 AI 到人类通信、未来 AI GUI 等的绝佳界面。想想通过一个极好的图表或动画来理解某事物是多么容易,而不是一堆文字。而且这是一个适合人类创造力的绝佳媒介。但这种天生的高带宽媒介也变得可直接优化。在我看来,TikTok 与可能的未来相比不值一提。而且我不太确定我们是否会喜欢“最优”的样子。
Gina Acosta
距离 Google 发布 Veo 3 仅一天。

新模型从单个提示同时生成视频和音频!

以下是迄今为止的 13 个疯狂示例:

1. 具有自我意识的 AI 角色
https://t.co/1HYcoHzJaP
动态Andrej Karpathy2025-06-02原文

相关内容