云知声发布 U2-Flash:266B 稀疏 MoE 模型,主打递归自我改进
国产厂商首次公开完整 RSI 后训练闭环的落地成果:小激活参数模型靠自我生成训练数据反打旗舰,值得关注后训练路线是否就此改写。
云知声发布 U2-Flash,采用稀疏 MoE 架构(混合专家,推理时只激活部分参数),总参数 266B、单次激活约 10B。生成速度比 U2 快 2.1 倍,Agent 任务耗时缩短 35%,Token 消耗降低 20%–30%。它用「模型自己出题、自己练」的递归自我改进(RSI)闭环做后训练,已自主构建近 10 万道代码任务,输入 0.6 元/百万 Tokens。
正文摘录
从硅谷一路烧到国内,「让模型参与训练下一版自己」几乎一夜之间成了 AI 圈最热的叙事。 而就在这一当口,「港股 AGI 第一股」云知声正式发布 U2-Flash,率先交出一份国产 RSI 早期答卷。 速度和省钱能力的提升确实没含糊。相比 U2,其生成速度提升 2.1 倍,Agent 任务完成时间缩短 35%,任务迭代步数和 Token 消耗也降低了 20% 至 30%。 它采用稀疏 MoE 架构,总参数约 266B,单次推理只激活约 10B,不到总参数的 4%,却在代码、Agent 等任务上,交出了足以和主力模型正面掰手腕的成绩,部分表现甚至闯进万亿参数级模型所在的区间。 打开云知声 MaaS 平台,U2-Flash 已经摆在首页,平台支持在线体验以及申请 API 调用。 重点看了下 API,它同时兼容 OpenAI 和 Anthropic 两套主流协议,Claude Code、Trae、Cursor、Cline 这些常用工具官方给了接入方式,剩下的 Harness 只要支持自定义模型,换下 Base URL、API Key 和模型 ID 就能接。 顺带一提,U2-Flash 还提供 none、low、high 和 max 四档思考强度,可以按任务难度在速度和推理深度之间切换,不过 WorkBuddy 这次没有开放手动切档,我也就没有强行横评。 输入价格 0.6 元/百万 Tokens、输出价格 1.2 元/百万 Tokens、缓存命中价格 0.12 元/百万 Tokens。 1 亿 Tokens,按一次代码仓库分析或长文档任务消耗几十万到百万 Tokens 计算,也够连续跑上数十到上百次。 我直接拉了一个表格对比了一下 U2 和 U2-Flash,然后挑出了三个需要重点测试的地方。