GLM-5.3 驱动的 Infra Agent 两周内将生产吞吐提升 3.2 倍
两周。
这就是从 GLM-5.3-Flash 首次在国产加速器上跑通,到承接它全部生产流量所花的时间,期间端到端吞吐还提升了 3.2 倍。
我一直反复在想的是:大部分工作是谁做的——一个由 GLM-5.3 驱动的 Infra Agent。
一个模型,在帮助优化为它自己提供服务的系统。
条件很苛刻。内存和互联带宽有限。1M token 上下文。多模态请求。软件栈还不成熟,内核缺失,文档常常只能靠猜。每一项优化都是一次权衡:用计算换内存(ReplaySSM),用通信换内存(节点内张量并行),用精度换容量(INT8/FP8/BF16 混合缓存),用解耦换调度自由度(Encode–Prefill–Decode)。
但最重要的教训与任何单项优化都无关。
当 agent 卡住时,原因很少是它写不出代码,而是它不知道*为什么*情况变糟了。
"吞吐下降 20%" 只告诉你出了问题,却没告诉你是哪一层、哪个假设、下一步该测什么。用 RL 的话说,这是稀疏奖励加上信用分配问题。而一个要跑几个小时的端到端 benchmark,会让探索慢得痛苦。
资深工程师靠脑中隐式的过程奖励来解决这个问题。他们知道什么时候该看时间线,什么时候该跑微基准,该对比哪一层的输出。
所以我们把它显式化了。我们称之为密集反馈:agent 可以直接调用的分层验证接口。
正确性反馈:算对了吗?
系统行为反馈:时间花在哪了?
性能反馈:哪个方案胜出,在什么条件下?
每个信号都必须是局部的、廉价的、可客观验证的。
agent 发现了三件事:
第一,KDA 上下文并行路径中的精度漂移,会随序列长度增长。原因是 TF32 舍入误差在链式状态矩阵合并中不断累积。修复现已上游合入 Flash Linear Attention(PR #1180)。
第二,KV 传输从未与 DeepEP dispatch 重叠。agent 沿着调用链跨越 Python/C++ 边界追踪,发现节点内路径从未释放 GIL。修复后,传输开销从 30% 以上降到 1% 以下。
第三,一个 decode kernel 因为分块方式,把同一个归一化重复计算了四次。agent 重构了它,拿到 1.71 倍加速。这个思路来自它通过阅读 SGLang、FLA 和 DeepGEMM 中现有 kernel 而蒸馏出的"优化骨架"。
需要把边界说清楚:人仍然负责定义目标、搭建反馈环境、审查每一项高风险改动。
但工程师的角色正在改变,从解决问题的人,变成设计反馈的人。
还有更深一层的含义。一个建立在真实基础设施任务之上、分层且可验证的反馈环境,正是训练下一代模型最需要的东西。agent 完成的每一项任务,都可以成为它继任者的训练场。
我们距离递归自我改进还很远。
但最小的回路已经存在。
模型优化系统。系统服务于模型。
这就是从 GLM-5.3-Flash 首次在国产加速器上跑通,到承接它全部生产流量所花的时间,期间端到端吞吐还提升了 3.2 倍。
我一直反复在想的是:大部分工作是谁做的——一个由 GLM-5.3 驱动的 Infra Agent。
一个模型,在帮助优化为它自己提供服务的系统。
条件很苛刻。内存和互联带宽有限。1M token 上下文。多模态请求。软件栈还不成熟,内核缺失,文档常常只能靠猜。每一项优化都是一次权衡:用计算换内存(ReplaySSM),用通信换内存(节点内张量并行),用精度换容量(INT8/FP8/BF16 混合缓存),用解耦换调度自由度(Encode–Prefill–Decode)。
但最重要的教训与任何单项优化都无关。
当 agent 卡住时,原因很少是它写不出代码,而是它不知道*为什么*情况变糟了。
"吞吐下降 20%" 只告诉你出了问题,却没告诉你是哪一层、哪个假设、下一步该测什么。用 RL 的话说,这是稀疏奖励加上信用分配问题。而一个要跑几个小时的端到端 benchmark,会让探索慢得痛苦。
资深工程师靠脑中隐式的过程奖励来解决这个问题。他们知道什么时候该看时间线,什么时候该跑微基准,该对比哪一层的输出。
所以我们把它显式化了。我们称之为密集反馈:agent 可以直接调用的分层验证接口。
正确性反馈:算对了吗?
系统行为反馈:时间花在哪了?
性能反馈:哪个方案胜出,在什么条件下?
每个信号都必须是局部的、廉价的、可客观验证的。
agent 发现了三件事:
第一,KDA 上下文并行路径中的精度漂移,会随序列长度增长。原因是 TF32 舍入误差在链式状态矩阵合并中不断累积。修复现已上游合入 Flash Linear Attention(PR #1180)。
第二,KV 传输从未与 DeepEP dispatch 重叠。agent 沿着调用链跨越 Python/C++ 边界追踪,发现节点内路径从未释放 GIL。修复后,传输开销从 30% 以上降到 1% 以下。
第三,一个 decode kernel 因为分块方式,把同一个归一化重复计算了四次。agent 重构了它,拿到 1.71 倍加速。这个思路来自它通过阅读 SGLang、FLA 和 DeepGEMM 中现有 kernel 而蒸馏出的"优化骨架"。
需要把边界说清楚:人仍然负责定义目标、搭建反馈环境、审查每一项高风险改动。
但工程师的角色正在改变,从解决问题的人,变成设计反馈的人。
还有更深一层的含义。一个建立在真实基础设施任务之上、分层且可验证的反馈环境,正是训练下一代模型最需要的东西。agent 完成的每一项任务,都可以成为它继任者的训练场。
我们距离递归自我改进还很远。
但最小的回路已经存在。
模型优化系统。系统服务于模型。