发布MiMo-V2-Pro等模型,面向Agent时代
MiMo-V2-Pro & Omni & TTS 发布了。这是我们第一个真正为Agent时代构建的全栈模型族。
我称之为一场安静的伏击——不是因为我们计划好的,而是因为从Chat到Agent范式的转变发生得太快,连我们自己都几乎不敢相信。在这个过程中,有激动、痛苦和迷人的时刻。
1T基础模型几个月前开始训练。最初的目标是长上下文推理效率。混合注意力带来了真正的创新,没有过度延伸——结果证明它正是Agent时代的正确基础。1M上下文窗口。MTP推理实现超低延迟和成本。这些架构决策并非赶时髦。它们是我们提前建立的结构性优势。
改变一切的是第一次体验复杂的agentic scaffold——我称之为编排的上下文。第一天我就震惊了。我试图说服团队使用它,但没用。于是我下了硬命令:明天之前,MiMo团队中对话少于100条的人可以辞职。这奏效了。一旦团队的想象力被agentic系统所能做的事情点燃,这种想象力直接转化为研究速度。
人们问为什么我们行动这么快。我在构建DeepSeek R1时亲眼目睹了这一点。我诚实地总结:
— 骨干和基础设施研究周期长。你需要战略信念,提前一年才能见效。
— 后训练敏捷性是一种不同的肌肉:产品直觉驱动评估,迭代周期压缩,范式转换及早捕捉。
— 不变的是:好奇心、敏锐的技术直觉、果断的执行、全情投入——以及容易被低估的一点:对你正在构建的世界真正的热爱。
当模型足够稳定时,我们会开源。
来自北京,深夜,半梦半醒。
我称之为一场安静的伏击——不是因为我们计划好的,而是因为从Chat到Agent范式的转变发生得太快,连我们自己都几乎不敢相信。在这个过程中,有激动、痛苦和迷人的时刻。
1T基础模型几个月前开始训练。最初的目标是长上下文推理效率。混合注意力带来了真正的创新,没有过度延伸——结果证明它正是Agent时代的正确基础。1M上下文窗口。MTP推理实现超低延迟和成本。这些架构决策并非赶时髦。它们是我们提前建立的结构性优势。
改变一切的是第一次体验复杂的agentic scaffold——我称之为编排的上下文。第一天我就震惊了。我试图说服团队使用它,但没用。于是我下了硬命令:明天之前,MiMo团队中对话少于100条的人可以辞职。这奏效了。一旦团队的想象力被agentic系统所能做的事情点燃,这种想象力直接转化为研究速度。
人们问为什么我们行动这么快。我在构建DeepSeek R1时亲眼目睹了这一点。我诚实地总结:
— 骨干和基础设施研究周期长。你需要战略信念,提前一年才能见效。
— 后训练敏捷性是一种不同的肌肉:产品直觉驱动评估,迭代周期压缩,范式转换及早捕捉。
— 不变的是:好奇心、敏锐的技术直觉、果断的执行、全情投入——以及容易被低估的一点:对你正在构建的世界真正的热爱。
当模型足够稳定时,我们会开源。
来自北京,深夜,半梦半醒。