罗福莉谈MiMo团队Agent开发经验及管理风格
传说中的DeepSeek天才少女、雷军千万年薪挖角的罗福莉也开始发推了。
帖子里最生动的段落是关于她第一次使用复杂 Agent 脚手架的经历。她用的词是:orchestrated Context,编排过的上下文,我理解就是现在比较火的 Harness Engineering。
她说第一天就被震惊了,然后试图说服团队去用,没成功,于是下了一个硬性命令:
> MiMo 团队里,明天对话数不到 100 条的人,可以辞职了。
这个管理风格相当激进,但有效。一旦团队的想象力被 Agent 系统的能力点燃,这种想象力就直接转化成了研发速度。
一方面确实霸气,一方面也让我有点意外,原以为大模型团队应该是更积极拥抱这种从传统 Chat 模型到 Agent 模型范式变化的。
其他都是“干货”
1. 提前押注的架构优势
1T 底座模型几个月前就开始训练了,当时的目标是长上下文推理效率。采用了 Hybrid Attention 机制(混合注意力,简单说就是不让所有 token 都互相关注,而是让一部分用全局注意力、一部分用局部注意力,大幅降低计算成本),支持百万 token 上下文窗口,加上 MTP 推理层(Multi-Token Prediction,一次预测多个 token 而不是一个一个蹦,推理延迟和成本都大幅下降)。
这些架构决策在当时并不时髦,但它们恰好成了 Agent 时代的结构性优势。
2. 为什么 MiMo 团队能这么快
罗福莉在做 DeepSeek R1 的时候亲眼见证过的真实总结:
— 基座与基础设施研究周期很长。你需要在它产出回报的一年前就有战略定力。
— 后训练的敏捷性是另一种能力:靠产品直觉驱动评估,压缩迭代周期,及早捕捉范式转换。
— 还有那些不变的东西:好奇心、敏锐的技术直觉、果断的执行力、全力以赴。
以及一样很容易被低估的东西:对你正在为之构建的世界,发自内心的热爱。
3. 模型会开源的,等模型稳定到值得开源的时候。
帖子里最生动的段落是关于她第一次使用复杂 Agent 脚手架的经历。她用的词是:orchestrated Context,编排过的上下文,我理解就是现在比较火的 Harness Engineering。
她说第一天就被震惊了,然后试图说服团队去用,没成功,于是下了一个硬性命令:
> MiMo 团队里,明天对话数不到 100 条的人,可以辞职了。
这个管理风格相当激进,但有效。一旦团队的想象力被 Agent 系统的能力点燃,这种想象力就直接转化成了研发速度。
一方面确实霸气,一方面也让我有点意外,原以为大模型团队应该是更积极拥抱这种从传统 Chat 模型到 Agent 模型范式变化的。
其他都是“干货”
1. 提前押注的架构优势
1T 底座模型几个月前就开始训练了,当时的目标是长上下文推理效率。采用了 Hybrid Attention 机制(混合注意力,简单说就是不让所有 token 都互相关注,而是让一部分用全局注意力、一部分用局部注意力,大幅降低计算成本),支持百万 token 上下文窗口,加上 MTP 推理层(Multi-Token Prediction,一次预测多个 token 而不是一个一个蹦,推理延迟和成本都大幅下降)。
这些架构决策在当时并不时髦,但它们恰好成了 Agent 时代的结构性优势。
2. 为什么 MiMo 团队能这么快
罗福莉在做 DeepSeek R1 的时候亲眼见证过的真实总结:
— 基座与基础设施研究周期很长。你需要在它产出回报的一年前就有战略定力。
— 后训练的敏捷性是另一种能力:靠产品直觉驱动评估,压缩迭代周期,及早捕捉范式转换。
— 还有那些不变的东西:好奇心、敏锐的技术直觉、果断的执行力、全力以赴。
以及一样很容易被低估的东西:对你正在为之构建的世界,发自内心的热爱。
3. 模型会开源的,等模型稳定到值得开源的时候。
MiMo-V2-Pro、Omni和TTS已发布。这是我们首个真正为Agent时代构建的全栈模型系列。我称其为一次静默伏击——并非因为我们计划如此,而是从Chat到Agent范式的转变如此之快,连我们自己都几乎不敢相信。在这之间,是...