热门产品

Qwen3.8-Flash-Next

Qwen3.8-Flash-Next

Qwen3.8-Flash-Next是Qwen4的开源预览版,一个125B多模态MoE模型,仅需6B激活参数,为开发者提供高效、先进的AI模型架构。

热门评论

PH 用户
大家好!

Qwen 之前就干过这事。Qwen3-Next 让大家提前看到了后来出现在 Qwen3.5 里的架构。

Qwen3.8-Flash-Next 也在为 Qwen4 做同样的事。

这是一个 125B 模型,只有 6B 激活参数,而且很多新设计都是为了在不让算力跟着涨的情况下获得更强能力。QSA 让长上下文检索成本更低,Gated Residual 让信息在网络中有了更多通路,新的 N-gram 记忆用很少的 per-token 算力就增加了容量。

Qwen 一直把这些架构预览做成大家真正能运行的模型发布出来,而且远在下一代正式到来之前。

而且权重已经放出来了 :)(许可证也值得一读)
PH 用户
gated residual + n-gram memory 这个组合是我最想琢磨的地方。改变信息在网络中的流动方式,通常意味着以前针对 Qwen3 构建的 LoRA 适配器和微调模型没法顺利迁到新架构上。这是这里的取舍吗,还是你们设计时就让现有的 Qwen3 工具链和适配器在它上面大多还能用?
PH 用户
Qwen3.8-Flash-Next 是一个 125B 的多模态 MoE,只有 6B 激活参数,新架构围绕 QSA、Gated Residual、N-gram embeddings 和 Muon 设计。它的开放权重让大家能提前看到 Qwen 为 Qwen4 打造的架构。
热门产品chen cheng2026-08-27原文

相关内容