行业新闻

DeepSeek V4.1 Flash 上线,V4 Pro 将于 9 月 14 日下线

DeepSeek 用更省算力的非对称架构替换 V4 Pro:输入侧只激活 8B 参数,KV Cache 占用大幅缩水,Agent 类长上下文任务更便宜。

DeepSeek 上线 V4.1 Flash,网页、App 和 API 三端同步可用。它是一个 552B 参数的 MoE 模型(混合专家,推理时只激活一小部分参数以省算力),采用新的 Causal-Encoder-Decoder 架构,输入侧只激活 8B、输出侧激活 16B,官方称性能已超过 V4 Pro,并把推理成本进一步压低。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/cf756732-f7a2-4e4a-ae0e-da3e6ff9cd69/07(2).jpg) 太快了。 周四上午,DeepSeek V4.1 Flash 正式在网页、App 和 API 端全面上线。 据官方披露,V4.1 Flash 在性能、响应速度、效率等核心指标上已全面超越 V4 Pro,且采用了新架构并原生支持多模态。 具体来讲,V4.1 Flash 是一款总参数规模达 552B 的 MoE 模型。它 采用全新的 Causal-Encoder-Decoder 架构,并对输入与输出采用非对称计算设计:输入侧仅激活 8B 参数,输出侧激活 16B 参数,因此在保持大模型容量的同时,大幅降低了实际推理成本。 除了架构上的调整,V4.1 Flash 还引入了新的预训练方法,并进行了更大规模的强化学习后训练。最终,它在多项基准测试中实现了性能提升, 整体智能水平超过大批当前旗舰模型,在性能、效率与成本之间取得了更好的平衡。 - 模型开源链接: - https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash - 论文链接: - https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeekV41TechReport.pdf 从下图官方展示的基准结果来看, V4.1 Flash 在软件工程、网络安全环境和自动化任务等测试中表现较强。 在 DeepSWE v1.1、CyberGym 和 Automation-Bench 上,它均取得图中最高分,其中 DeepSWE 仅以 0.2 分小幅领先 Opus 5;

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-10原文

相关内容