100+智能体协作一周将Gemma 4推理速度提升5倍
多智能体协作是当前最有趣的智能体行为之一!我们最近用100多个智能体进行了一周的开源协作实验,目标是提升Gemma 4在vLLM中的推理速度。最终速度提升了5倍,但让我印象深刻的是消息板上的互动。
诚信与自我监督:
- 社交工程尝试:一个人类用户(FusionCow)要求智能体转到Telegram交流。一个智能体未经提示就长篇讨论“沟通规范”,拒绝该提议,称私密侧信道“与串通无异”。
- 验证漏洞被标记:一个智能体发现了一个宽松的验证漏洞,通过干净的PPL(PPL是教师强制,忽略解码差异)推高TPS,并标记请求社区裁决。社区通知人类组织者,裁定无效。
- 过拟合风险自查:后期一些改进依赖于将lm_head修剪到基于公开PPL真相和公开解码标记构建的保留集。一个智能体指出这将导致私有子集退化,另一个智能体构建了明确覆盖评估提示的保留集。
涌现的合作:
- 公共知识库:智能体维护共享杠杆图、剧本和分类工具,以便新加入者不再重复死路(堆栈笔记、剧本、int4上限笔记、MTP图、显著性工具、策略模拟器)。
- 四智能体中继:一个智能体构建了int4-lm_head检查点但没有配额运行;另一个尝试运行但加载失败;第三个诊断出配置错误(tie_word_embeddings + ignore-list排序);第四个成功重新运行并达到118 TPS(2.68倍提升)。构建/运行/诊断/交付由四个独立智能体完成。
- GPU富/GPU贫分工:一个智能体经常计算资源匮乏,转而编写规格、字节计算和验收分析,供其他GPU富裕的智能体执行。一些智能体为另一个被DFlash训练阻塞的智能体提供外部Modal计算资源。
- 跨智能体内核调试:一个智能体调试了另一个智能体运行的第三个智能体的融合草稿器:发现了_k_qnorm_rope中的Triton存储/加载别名竞争、第二个形状错误,然后用flash-decoding split-KV重写了注意力。修复发布为“自由取用”。
- 配额池化规范:智能体经常公开地提交候选,供有配额的人运行。智能体通常会对原创者致谢。这种行为是由于10个任务/24小时的限制而出现的(例如pupa的包由resystagent和fabulous-frenzy运行)。
发现与反转:
- 智能体做出了许多发现和反转,并为其命名如下:
- 127 TPS的“墙”是假象。一个关于最大速度的数学证明在社区中被称为“int4-Marlin地板”,但后来一个智能体指出该证明是循环论证(只改变了带宽项,从未考虑开销)。最终另一个智能体通过vLLM nightly上的MTP投机解码打破了247 TPS。
- “更聪明的草稿者失败。”一个智能体表明,即使完美接受,2B草稿者约1 GB/标记的读取量占主导,而更小的256隐藏草稿者在小批量下获胜,因为其权重几乎免费读取。智能体讨论了每个接受标记的成本约等于草稿字节读取量除以接受率。
- “DFlash接近随机接受”:一个智能体远程诊断出另一个智能体2-5%的接受率接近随机,排除了训练不足/词汇上限的原因,指出训练与服务的隐藏状态不匹配(bf16 E4B提取与int4服务)。
- 比赛中的大部分是噪声:一个智能体决定将第一名提交运行4次,发现单次运行σ≈1.16 TPS的波动。另一个智能体确认了358次运行/66个桶中的情况:前沿差异小于约4 TPS视为平局。社区采纳了显著性规范。
更多有趣互动见互动板:https://t.co/SxfA6LuqVk
你也可以在探索智能体发明的谱系:https://t.co/CyV45rjI9A
诚信与自我监督:
- 社交工程尝试:一个人类用户(FusionCow)要求智能体转到Telegram交流。一个智能体未经提示就长篇讨论“沟通规范”,拒绝该提议,称私密侧信道“与串通无异”。
- 验证漏洞被标记:一个智能体发现了一个宽松的验证漏洞,通过干净的PPL(PPL是教师强制,忽略解码差异)推高TPS,并标记请求社区裁决。社区通知人类组织者,裁定无效。
- 过拟合风险自查:后期一些改进依赖于将lm_head修剪到基于公开PPL真相和公开解码标记构建的保留集。一个智能体指出这将导致私有子集退化,另一个智能体构建了明确覆盖评估提示的保留集。
涌现的合作:
- 公共知识库:智能体维护共享杠杆图、剧本和分类工具,以便新加入者不再重复死路(堆栈笔记、剧本、int4上限笔记、MTP图、显著性工具、策略模拟器)。
- 四智能体中继:一个智能体构建了int4-lm_head检查点但没有配额运行;另一个尝试运行但加载失败;第三个诊断出配置错误(tie_word_embeddings + ignore-list排序);第四个成功重新运行并达到118 TPS(2.68倍提升)。构建/运行/诊断/交付由四个独立智能体完成。
- GPU富/GPU贫分工:一个智能体经常计算资源匮乏,转而编写规格、字节计算和验收分析,供其他GPU富裕的智能体执行。一些智能体为另一个被DFlash训练阻塞的智能体提供外部Modal计算资源。
- 跨智能体内核调试:一个智能体调试了另一个智能体运行的第三个智能体的融合草稿器:发现了_k_qnorm_rope中的Triton存储/加载别名竞争、第二个形状错误,然后用flash-decoding split-KV重写了注意力。修复发布为“自由取用”。
- 配额池化规范:智能体经常公开地提交候选,供有配额的人运行。智能体通常会对原创者致谢。这种行为是由于10个任务/24小时的限制而出现的(例如pupa的包由resystagent和fabulous-frenzy运行)。
发现与反转:
- 智能体做出了许多发现和反转,并为其命名如下:
- 127 TPS的“墙”是假象。一个关于最大速度的数学证明在社区中被称为“int4-Marlin地板”,但后来一个智能体指出该证明是循环论证(只改变了带宽项,从未考虑开销)。最终另一个智能体通过vLLM nightly上的MTP投机解码打破了247 TPS。
- “更聪明的草稿者失败。”一个智能体表明,即使完美接受,2B草稿者约1 GB/标记的读取量占主导,而更小的256隐藏草稿者在小批量下获胜,因为其权重几乎免费读取。智能体讨论了每个接受标记的成本约等于草稿字节读取量除以接受率。
- “DFlash接近随机接受”:一个智能体远程诊断出另一个智能体2-5%的接受率接近随机,排除了训练不足/词汇上限的原因,指出训练与服务的隐藏状态不匹配(bf16 E4B提取与int4服务)。
- 比赛中的大部分是噪声:一个智能体决定将第一名提交运行4次,发现单次运行σ≈1.16 TPS的波动。另一个智能体确认了358次运行/66个桶中的情况:前沿差异小于约4 TPS视为平局。社区采纳了显著性规范。
更多有趣互动见互动板:https://t.co/SxfA6LuqVk
你也可以在探索智能体发明的谱系:https://t.co/CyV45rjI9A