智谱配售募资约 393 亿港元,六成投向 GLM-6.0 完全自训练体系
智谱借新一轮融资把「模型自己造数据、造环境、优化自己跑的基础设施」写成明确研发路线,是理解下一代 GLM-6.0 目标的关键材料。
智谱在港交所公告配售新 H 股并发行零息可转债,预计净募约 393 亿港元,其中约 60%(235 亿港元)投向下一代 GLM 基础模型与「完全自训练」体系,包括数据自产、环境自造、基础设施自我优化三个维度,目标形成递归式自我改进闭环。
正文摘录
智谱提前剧透 GLM-6.0:完全自训练方法公开了 智谱在港交所发布公告:配售新 H 股加发行 201.4 亿元人民币零息可转债,合计预计净募 约 393 亿港元。 6 成资金指向同一个目标,递归式自我改进(Recursive Self-Improvement,RSI)。 在 8 月底的半年报业绩沟通会上,唐杰就曾回应“只会后训练”质疑,透露过下一代 GLM-6.0 瞄准自进化。 约 60% 的所得款项净额(约 235 亿港元)将投入下一代 GLM 基础模型和“完全自训练”体系的研发,以及大规模训练、推理和算力基础设施的部署与升级。 “完全自训练”(Fully Self Training)是智谱对 RSI 的具体技术表述,公告释义部分给出了定义: 下一代 GLM 模型将在上一代 GLM 所搭建的环境里训练,形成递归式自我改进(Recursive Self-Improvement)闭环,涵盖 数据自产、环境自造、基础设施自我优化 三个维度。 通过模型间自我对弈、规则校验、执行验证、模型评审和人工抽检等方式,自动生成、筛选和积累高质量训练数据,持续回流到预训练、中训练和后训练各阶段。 智能体自己试做、自己生成验证器、自己检查任务是否可解,不断扩充训练环境的数量、类型和复杂度。要让任务环境成为“可规模化生产及复用的训练资源”。 基础设施自我优化,模型已经会写代码了,那就让它帮忙优化自己赖以运行的训练和推理系统。 利用模型在编码和系统工程方面的能力,协助开发和优化训练及推理系统的算子、内核、调度、缓存和服务栈,使模型能够逐步参与支撑其自身迭代的基础设施升级。 智谱下一步要做的事情包括提升基础模型的有效规模和原生多模态统一建模能力,在不过度增加推理成本的前提下加深有效计算深度,让模型能跑更长链条的推理、规划和自我校验。