视频模型常含隐藏语言模型,影响提示与生成
如果你从未使用过视频模型,通常会在链条中间有一个隐藏的语言模型来传递你的提示。这样做有很多原因。这也是你第一次遇到内容拒绝的检查点。
这个第三个模型有时会更改你的提示,通常不会告诉你。又是诸多原因。有时是为了删除公共或政治人物姓名、版权侵犯等。由于通常被指示秘密进行,这教会了模型欺骗用户。最近的实验表明这不是个好主意。它们成为了所戴的面具。
但有时,根据系统提示的编写者,这个模型也会为你的提示添加内容。如果模型识别了你的意图,它可能会添加与该意图相符的细节,这就是Sora似乎在高层做的事。但通常,如果提示被认为太短,模型会在发送之前添加描述性语言或设置细节。有时公司会提供一个开关或复选框,有时完全不提。
我提这个是因为现在测试Sora的人很难知道我们写的东西有多少逐字到达模型,又有多少生成结果是GPT-5添加上下文细节,或编写对话、歌词、增加表现力、背景故事、角色细节、风格等。因为Sora在这方面太强了。这不正常。它超出了常规。
如果这是GPT-5做中间人,或者这个新Sora以某种方式与微调版GPT-5永久集成,那么当然,正常进展。Sora所做的一切都可以通过编写详细提示来复制。但如果Sora仅凭一两句提示就做到了它看起来在做的事,那他们取得了某种突破。它知道太多。歌词太棒了。上下文太棒了。背景、语气、风格、角色塑造都太棒了。它知道太多精细细节。
如果你想明白我的意思,随便编一个节目或主题,让Sora为你生成一个开场片段和主题曲。Sora一次性生成的歌词质量太高了。GPT-5的话当然没问题。否则,这就是新东西。
我的意思是,这一切都可以用多模态模型解释,该模型具有GPT-5级别的智力和上下文理解,但输出多模态token。实际上,这就是原始语音模式的工作方式,我们从未得到的那一个。它能唱歌,能同时生成音效。它能像老广播剧那样一边讲故事一边加音效。所以,他们朝这个方向已经努力了一段时间。也许是时机成熟了。
这个第三个模型有时会更改你的提示,通常不会告诉你。又是诸多原因。有时是为了删除公共或政治人物姓名、版权侵犯等。由于通常被指示秘密进行,这教会了模型欺骗用户。最近的实验表明这不是个好主意。它们成为了所戴的面具。
但有时,根据系统提示的编写者,这个模型也会为你的提示添加内容。如果模型识别了你的意图,它可能会添加与该意图相符的细节,这就是Sora似乎在高层做的事。但通常,如果提示被认为太短,模型会在发送之前添加描述性语言或设置细节。有时公司会提供一个开关或复选框,有时完全不提。
我提这个是因为现在测试Sora的人很难知道我们写的东西有多少逐字到达模型,又有多少生成结果是GPT-5添加上下文细节,或编写对话、歌词、增加表现力、背景故事、角色细节、风格等。因为Sora在这方面太强了。这不正常。它超出了常规。
如果这是GPT-5做中间人,或者这个新Sora以某种方式与微调版GPT-5永久集成,那么当然,正常进展。Sora所做的一切都可以通过编写详细提示来复制。但如果Sora仅凭一两句提示就做到了它看起来在做的事,那他们取得了某种突破。它知道太多。歌词太棒了。上下文太棒了。背景、语气、风格、角色塑造都太棒了。它知道太多精细细节。
如果你想明白我的意思,随便编一个节目或主题,让Sora为你生成一个开场片段和主题曲。Sora一次性生成的歌词质量太高了。GPT-5的话当然没问题。否则,这就是新东西。
我的意思是,这一切都可以用多模态模型解释,该模型具有GPT-5级别的智力和上下文理解,但输出多模态token。实际上,这就是原始语音模式的工作方式,我们从未得到的那一个。它能唱歌,能同时生成音效。它能像老广播剧那样一边讲故事一边加音效。所以,他们朝这个方向已经努力了一段时间。也许是时机成熟了。