DeepSeek 发布结构创新与超高上下文效率
结构创新与超高上下文效率
🔹 新型注意力:逐 token 压缩 + DSA(DeepSeek 稀疏注意力)。
🔹 峰值效率:以大幅降低的计算和内存成本实现世界领先的长上下文。
🔹 1M 标准:1M 上下文现为所有 DeepSeek 官方服务的默认配置。
4/n
🔹 新型注意力:逐 token 压缩 + DSA(DeepSeek 稀疏注意力)。
🔹 峰值效率:以大幅降低的计算和内存成本实现世界领先的长上下文。
🔹 1M 标准:1M 上下文现为所有 DeepSeek 官方服务的默认配置。
4/n