行业新闻

科大讯飞发布星火X2.5端侧模型,支持断网运行复杂任务

科大讯飞发布星火X2.5端侧模型,支持断网运行复杂任务

这款小模型把复杂智能体能力塞进4B参数,断网也能干活,让端侧AI跨过“好用”门槛。

科大讯飞旗下词元星火发布开源端侧模型星火X2.5,4B和1.7B两个版本基于全国产算力训练。4B模型在工具调用、智能体任务等测试中表现超越同尺寸对手,能在断网笔记本上完成合同审阅、数据分析等复杂工作,权重仅占用8GB内存,适合内网和终端部署。

正文摘录

![](/r/blog/977f7523f7c26484ef15c15f3400b7756a4ff2c6525c25a00b56dd1e3ded6d6c.webp) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/09/aieraimg3b253ef414-18.png) 就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。 事情是这样的。 9月1日,Hugging Face上线了两个开源端侧模型: 星火X2.5-4B和1.7B 。 本以为只能干干文本补全的轻活,结果一上榜单,4B模型硬是当着一众大一两 圈的对手,狠狠地秀了一把肌肉。 ![](/r/blog/6a4404e207610a46d9068947ab4fa928bd44ab1b82e633f56b5f0541a1bc5e97.jpg) - 比如考验多轮工具调用的 τ³-bench ,拿了30.4分。这测的是极限定力,几十步操作连轴转,中间只要错一步,整个任务直接拉胯。 - 测试MCP协议的 MCP-Atlas ,拿下54.6分。把它丢进真实的API环境里,它给接口填的参数严丝合缝,一点报错的空子都不钻。 - 自主上网搜信息的 BrowseComp ,跑到40.9分。哪怕网页里一堆弹窗和垃圾代码,它照样能像活人一样,把有效数据生抠出来。 - 至于专考「听人话」的 IFBench ,更是飙到了75.0分。面对那种字数超长、格式层层叠加的变态指令,它硬是做到了一丝不差。 在考察智能体(Agent)、工具调用和真实任务完成率这几项硬指标上,更是实现了「越级打怪」。 1.7B版本也不含糊。在考察MCP工具使用的MCP-Atlas里,它拿了23.4分,同尺寸这一档里最高。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-09-03原文

相关内容