行业新闻

腾讯混元提出 LLM 强化学习的 Batch Size 规模化准则

腾讯混元从第一性原理分析 LLM 强化学习中 Batch Size 的规模化边界,给出一套找到最短 time-to-target 的准则,直接关系到万卡以上集群的算力成本。

强化学习在模型训练中占比越来越大,训练效率直接决定算力账单。腾讯混元团队把 Batch Size(每次参数更新处理的数据量)放回训练动力学与硬件执行的共同约束下,研究在 LLM 强化学习里——模型既生成数据又消费数据——Batch 能有效扩大到什么程度,以及怎样找到让模型最快达标的那个大小。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/e4bbce22-121c-4fbf-b749-f253179069d1/079(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 强化学习走向规模化,效率成为关键变量 当预训练把大模型带到新的能力起点之后,强化学习通过持续的探索与反馈,不断激发模型在新环境、新任务中的推理与行动能力,决定它们还能走多远。 RL 在模型开发中占的比重越大,训练效率对算力预算的影响也越直接。 算一笔示意账:假设 1 万张 GPU 连续运行 30 天,按每卡每小时 3 美元计算,总费用是 2,160 万美元。如果使用同样的卡数、达到同样的模型效果,但把训练时间缩短 10%,就能少用 72 万 GPU 小时,按上述假设计省约 216 万美元。对租用集群的团队来说,这是直接减少的账单;对自建集群的团队来说,则意味着能更早把这些算力交给下一轮实验。 这些效率收益可以从哪里找?一个最基础、也几乎所有训练配方都无法绕开的参数,就是 Batch Size 。 在实际训练中,Batch Size 常常出现在两类决策中: - Batch Size Tuning:让配方适配新条件。 模型变大了,或者 GPU 卡型变了,原来的 Batch 和学习率不一定还合适。Batch 太小可能让硬件利用不充分,与之不匹配的学习率则可能让学习变慢甚至不稳定。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-22原文

相关内容