行业新闻

高效推理 MiniMax-M3:解锁 1M 令牌上下文与多模态,无 regrets

高效推理 MiniMax-M3:解锁 1M 令牌上下文与多模态,无 regrets

文章介绍 Together AI 如何用多项工程优化高效部署 MiniMax-M3,实现百万级上下文和多模态推理,对关注长上下文模型服务的读者有启发。

Together AI 通过 KV-block-major 稀疏注意力(一种按块管理键值对以跳过不相关部分的注意力机制)、paged MSA 解码(分页处理多查询注意力)、优化索引评分以及基于 Rust 的多模态网关,实现了 MiniMax-M3 模型的高效托管,支持超长上下文与多模态输入。

正文摘录

Serving MiniMax-M3 高效推理:解锁 1M Token 上下文与多模态,不留遗憾 - 来源公司:Together AI - 正文: Together AI 是 MiniMax M3 的首选云合作伙伴。M3 作为开放权重模型公开发布后,Together AI 将以其开发者端点形式托管该模型。 我们的推理与内核团队为实现 M3 的高效服务交付了重大工程突破,包括关键优化如 KV-Block-Major 稀疏注意力内核、面向 MSA 的新型分页注意力集成、高度优化的索引评分内核,以及基于 Rust 的多模态预处理网关,在不同并发级别上实现了 81–125% 的吞吐量提升。 大规模生产环境下 Serving MiniMax M3,验证了 Together AI 是处理那些在严峻系统工程问题上不断突破边界的模型的理想推理平台,使真实世界部署成为可能。 MiniMax 发布了其最新 SOTA 模型 M3,Together AI 很荣幸成为首选云合作伙伴,助力 MiniMax 在生产环境中高效大规模服务 M3。未来几天 MiniMax M3 将作为开放权重模型发布,届时 Together AI 也将直接为开发者提供该模型的端点服务。这背后是 Together AI 推理与内核团队的卓越工作,他们为这一突破边界的模型——1M Token 上下文窗口、原生多模态、以及需要强大工程支撑才能高效服务的架构——驱动了深度性能优化,并确保了生产级可靠性。在本文中,我们将详细介绍实现过程。祝贺 MiniMax 团队推出的里程碑式模型发布与持续创新。 MiniMax M3 是一款全能模型,集成了最先进的编码性能、智能体工作流支持以及原生多模态推理。在这些能力之上,它还支持 1M 上下文,同时保持极具经济效益的服务成本。

阅读原文(together.ai)→

行业新闻2026-06-02原文

相关内容