行业新闻

阿里云栖大会公布 Qwen 进展:Qwen4 已在训练,未来扩展至 5-10T 参数

阿里展示大模型自我迭代的落地成果——模型能在无人参与下改训练流程、调推理框架、做芯片设计,并把下一代 Qwen 的参数目标定到 5-10T。

9 月 22 日云栖大会上,阿里公布大模型系列进展:递归自我改进(RSI,让模型自己搭建训练流程、造数据、做实验并定位缺陷的技术)已初步进入训练、推理和芯模协同环节。Qwen3.8-Max 在零人工参与下自主迭代超 1 个月、完成 33 轮;新一代架构的 Qwen4 正在训练,Qwen4.5、Qwen5 计划将参数扩展至 5-10T。

正文摘录

9月22日,阿里巴巴在云栖大会上公布了大模型一系列进展,大模型递归自我改进(RSI)已初步进入模型训练、推理及芯模协同等环节中,基于新一代架构的 Qwen4 已在训练中,未来 Qwen4.5、Qwen5 等版本将扩展至 5-10T 参数。同时,视频生成模型、语音模型、图像模型、世界模型、音乐模型以及全模态模型等均在当天或近期推出新版本。 大模型正走向自我迭代,本届云栖大会,阿里系统展示了千问大模型自我进化的最新探索成果。 在模型自我训练上,Qwen3.8-Max 通过自主搭建训练流程、构造训练数据,并自主设计实验、定位缺陷,在人类完全“零参与”的情况下持续迭代超1个月,完成33轮有效迭代。基于 RSI、后训练等系列技术联合优化,Qwen3.8-Max 新版本在 Artificial Analysis 上的得分从40涨至45分,与 Claude、GPT 最强模型同处第一阵营,领先于 GLM5.3、Kimi-K3 等所有国产模型。 在推理优化上,Qwen3.8-Max 在从未见过的平头哥新款 GPU 上,自主适配优化了下代架构的 Qwen3.8-Flash 新模型的推理框架,实现单实例推理吞吐量提升 96%。 在芯片模型协同设计上,Qwen3.8-Max 仅基于一份真实的总线模块规范,自主展开前端、验证、后端的全链路自迭代,在自主运行超60小时、调用 EDA 工具超万次后,完成了减少42%面积的物理实现优化。 图说:Qwen LLM 项目负责人刘大一恒表示,Scaling 是迈向 ASI 的关键路径,Qwen4.5、Qwen5 参数规模计划迈向5到10T 大会现场,阿里展示了大模型核心领域的系列技术创新。在架构优化方面,Qwen3.8-Flash 提前开源下一代千问大模型架构,通过注意力机制和模型内信息传递机制等核心技术创新,在实现前沿模型性能的同时,训练成本骤降近90%;

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-09-22原文

相关内容