DeepSeek V4.1 Flash 开启测试,采用新模型结构
这篇报道指出,DeepSeek 用新架构快速推出 V4.1 Flash 内测,速度更快且成本可控,标志着大模型竞争进入高频迭代期。
DeepSeek 今日开放 V4.1 Flash 内测,采用新模型结构,支持原生多模态。API 用户手动添加模型 deepseek-v4.1-flash-expires-on-0910 即可使用,无额外门槛。实测生成 HTML 小游戏成本不到 2 元,速度较前代提升约 4-6 倍,社区测速达 400 token/s。该版本有效期至 9 月 10 日。
正文摘录
刚刚,DeepSeek V4.1开启测试 9 月的大模型会战,DeepSeek 应战了。 今天下午 3 点,DeepSeek 官方社区突然传来消息,DeepSeek V4.1 Flash 直接开始测试。 说是内测,不过对于使用 API 服务的用户来说,没有什么特殊的限制门槛,在现有 DeepSeek 服务商下 手动添加模型:deepseek-v4.1-flash-expires-on-0910,保留原来的 API Key 和 baseurl,再在新对话中选择它,就能直接用了 。 最近,「不加班」的 DeepSeek 也被全球的大模型浪潮裹挟着猛猛上新。此前 7 月底上线的 DeepSeek V4-Flash-0731 保持了原有模型结构,仅重新进行了后训练就取得了能力的大幅提升;8 月 13 日,DeepSeek V4 Pro 正式版与 DeepSeek Harness 共同问世,开始尝试通过布局生态来实现能力的最大化;8 月 21 日公开的 deepseek-v4-flash-vision-exp 则支持图文混合输入,结束了 DeepSeek 大模型没法看的历史。 值得注意的是,这次 V4.1 Flash 并不是一次简单的后训练更新。 V4-Flash-Vision-Exp 的一个官方示例:在 Agent 框架下生成商业定制西藏自驾游 PPT。 DeepSeek 明确提到 V4.1 Flash 使用了「新的模型结构」 ,不免让人有了更多期待。 目前因为只是内测,官方给出的信息不多。看起来,官方宣称的新结构虽然不至于是对模型架构的推翻,但可改的还有注意力机制、专家网络、视觉模块等等。不过既然有了「原生多模态」,我们可以期待像之前 v4-flash-vision-exp 那样,新模型能在大部分任务能力上都有进一步的提升。