阿里发布Qwen3.5三模型,27B性能优异,智能指数42
阿里巴巴扩展了其Qwen3.5模型家族,新增3款模型——27B模型表现突出,在Artificial Analysis Intelligence Index上获得42分,性能匹配8-25倍于其规模的开源权重模型。
@Alibaba_Qwen 在月初发布397B旗舰模型的基础上,扩展了Qwen3.5家族,新增三款模型:Qwen3.5 27B(密集模型,智能指数42)、Qwen3.5 122B A10B(MoE,42)和Qwen3.5 35B A3B(MoE,37)。两个MoE模型每次前向传播仅激活总参数的一小部分(122B中激活10B,35B中激活约3B)。智能指数是我们的综合指标,包含10项评估,涵盖通用推理、智能体任务、编程和科学推理。
所有模型采用Apache 2.0许可,原生支持262K上下文,并回归了原始Qwen3的统一思考/非思考混合架构,此前阿里巴巴在Qwen3 2507更新中转向了分离的指令和推理检查点。
推理变体的关键基准测试结果:
➤ Qwen3.5 27B在智能指数上获得42分,是230B以下最智能的模型。相近规模的最接近模型是GLM-4.7-Flash(31B总参,3B激活),得分30。同等智能水平的开源权重模型总参数大8-25倍:MiniMax-M2.5(230B,42)、DeepSeek V3.2(685B,42)和GLM-4.7(357B,42)。在FP8精度下,存储模型权重约需27GB,而4-bit量化则可在16GB以上RAM的笔记本电脑级别硬件上运行。
➤ Qwen3.5 27B在GDPval-AA(智能体真实工作任务)上得分1205,与更大模型并列。作为背景,MiniMax-M2.5得分1206,GLM-4.7(推理)得分1200,DeepSeek V3.2(推理)得分1194。这对于一个27B参数模型来说尤为显著,表明其强大的智能体能力。GDPval-AA测试模型在44个职业和9个主要行业的真实世界任务上的表现。
➤ AA-Omniscience仍然是Qwen3.5家族的一个相对弱点,主要由于准确率较低而非幻觉率。Qwen3.5 27B在AA-Omniscience上得分-42,与MiniMax-M2.5(-40)相当,但落后于DeepSeek V3.2(-21)和GLM-4.7(-35)。尽管Qwen3.5 27B的幻觉率(80%)低于同类(GLM-4.7 90%,MiniMax 89%,DeepSeek 82%),但其准确率也较低,为21%,而DeepSeek V3.2为34%,GLM-4.7为29%。这可能是模型规模的结果——我们通常观察到总参数更多的模型在AA-Omniscience上准确率更高,因为更广泛的知识回忆受益于更大的参数数量。
➤ Qwen3.5 27B与Qwen3.5 122B A10B智能水平相当。122B A10B是一个混合专家模型,每次前向传播仅激活122B总参数中的10B。27B模型在GDPval-AA上领先(1205 Elo vs 1145 Elo),在TerminalBench上略优(+1.5个百分点),而122B模型在SciCode(+2.5个百分点)、HLE(+1.2个百分点)上领先,并且幻觉率更低(Omniscience -40 vs -42)。
➤ Qwen3.5 35B A3B(推理,37)是约3B激活参数中最智能的模型,领先GLM-4.7-Flash(30)7分。其他约3B激活参数的模型包括Qwen3 Coder Next(80B总参,28)、Qwen3 Next 80B A3B(27)和NVIDIA Nemotron 3 Nano 30B A3B(24)。
➤ Qwen3.5 27B使用9800万输出令牌运行智能指数,通过阿里云API花费约299美元。与同等智能水平的模型相比,令牌使用量显著偏高:MiniMax-M2.5(5600万)、DeepSeek V3.2(6100万),甚至更大的Qwen3.5 397B(8600万)。
其他信息:
➤ 上下文窗口:262K令牌(可通过YaRN扩展到1M)
➤ 许可证:Apache 2.0
➤ API定价(阿里云):397B:每百万输入/输出令牌$0.60/$3.60,122B:$0.40/$3.20,27B:$0.30/$2.40,35B A3B:$0.25/$2.00
@Alibaba_Qwen 在月初发布397B旗舰模型的基础上,扩展了Qwen3.5家族,新增三款模型:Qwen3.5 27B(密集模型,智能指数42)、Qwen3.5 122B A10B(MoE,42)和Qwen3.5 35B A3B(MoE,37)。两个MoE模型每次前向传播仅激活总参数的一小部分(122B中激活10B,35B中激活约3B)。智能指数是我们的综合指标,包含10项评估,涵盖通用推理、智能体任务、编程和科学推理。
所有模型采用Apache 2.0许可,原生支持262K上下文,并回归了原始Qwen3的统一思考/非思考混合架构,此前阿里巴巴在Qwen3 2507更新中转向了分离的指令和推理检查点。
推理变体的关键基准测试结果:
➤ Qwen3.5 27B在智能指数上获得42分,是230B以下最智能的模型。相近规模的最接近模型是GLM-4.7-Flash(31B总参,3B激活),得分30。同等智能水平的开源权重模型总参数大8-25倍:MiniMax-M2.5(230B,42)、DeepSeek V3.2(685B,42)和GLM-4.7(357B,42)。在FP8精度下,存储模型权重约需27GB,而4-bit量化则可在16GB以上RAM的笔记本电脑级别硬件上运行。
➤ Qwen3.5 27B在GDPval-AA(智能体真实工作任务)上得分1205,与更大模型并列。作为背景,MiniMax-M2.5得分1206,GLM-4.7(推理)得分1200,DeepSeek V3.2(推理)得分1194。这对于一个27B参数模型来说尤为显著,表明其强大的智能体能力。GDPval-AA测试模型在44个职业和9个主要行业的真实世界任务上的表现。
➤ AA-Omniscience仍然是Qwen3.5家族的一个相对弱点,主要由于准确率较低而非幻觉率。Qwen3.5 27B在AA-Omniscience上得分-42,与MiniMax-M2.5(-40)相当,但落后于DeepSeek V3.2(-21)和GLM-4.7(-35)。尽管Qwen3.5 27B的幻觉率(80%)低于同类(GLM-4.7 90%,MiniMax 89%,DeepSeek 82%),但其准确率也较低,为21%,而DeepSeek V3.2为34%,GLM-4.7为29%。这可能是模型规模的结果——我们通常观察到总参数更多的模型在AA-Omniscience上准确率更高,因为更广泛的知识回忆受益于更大的参数数量。
➤ Qwen3.5 27B与Qwen3.5 122B A10B智能水平相当。122B A10B是一个混合专家模型,每次前向传播仅激活122B总参数中的10B。27B模型在GDPval-AA上领先(1205 Elo vs 1145 Elo),在TerminalBench上略优(+1.5个百分点),而122B模型在SciCode(+2.5个百分点)、HLE(+1.2个百分点)上领先,并且幻觉率更低(Omniscience -40 vs -42)。
➤ Qwen3.5 35B A3B(推理,37)是约3B激活参数中最智能的模型,领先GLM-4.7-Flash(30)7分。其他约3B激活参数的模型包括Qwen3 Coder Next(80B总参,28)、Qwen3 Next 80B A3B(27)和NVIDIA Nemotron 3 Nano 30B A3B(24)。
➤ Qwen3.5 27B使用9800万输出令牌运行智能指数,通过阿里云API花费约299美元。与同等智能水平的模型相比,令牌使用量显著偏高:MiniMax-M2.5(5600万)、DeepSeek V3.2(6100万),甚至更大的Qwen3.5 397B(8600万)。
其他信息:
➤ 上下文窗口:262K令牌(可通过YaRN扩展到1M)
➤ 许可证:Apache 2.0
➤ API定价(阿里云):397B:每百万输入/输出令牌$0.60/$3.60,122B:$0.40/$3.20,27B:$0.30/$2.40,35B A3B:$0.25/$2.00