行业新闻

OpenSquilla 0.5.0多模型集成登顶DRACO双榜

国产模型通过Harness层多模型集成协作,在真实任务跑分上超越海外旗舰,成本仅为其零头。

开源项目OpenSquilla发布0.5.0 Preview,核心是多模型集成:组合4个国产模型并行提案、聚合输出。在DRACO榜单上,该方案平均分高于Opus 4.8和GPT-5.5,成本仅$0.12;逼近Anthropic最新旗舰Fable 5且成本为其三分之一。团队认为,更好的组织方式胜过更强的单一模型。

正文摘录

开源AI Agent项目OpenSquilla近日发布0.5.0 Preview 1,核心更新是“多模型集成协作”(多模型 agentic routing):在 Harness 层把4个国产模型 DeepSeek v4、GLM-5.2、Kimi K2.7、Qwen3.7 组织成并行提案的协作队伍,再由1个模型聚合输出最终结果——阵容中没有任何一个海外旗舰模型。 与 Preview 同步,团队发布了《Agentic Routing》技术报告,阐述这套 Harness 原生路由如何把日常 Agent 流量转化为自我进化的数据飞轮;正式版本随后发布。 最新公布的 DRACO 深度研究榜单按搜索引擎分组对比各方案的平均分数与平均成本,OpenSquilla 的集成方案在两组均列第一。Brave Search 组:平均分64.09,高于单跑的 Opus 4.8(59.11,+8.42%)与 GPT-5.5(53.28,+20.27%),平均任务成本 $0.12,分别低约 92% 与 86%,同组唯一同时拿下“最高分”与“最低成本”双标记。DuckDuckGo 组:平均分60.85,略高于 Anthropic 最新旗舰 Fable 5 的59.80——分数基本持平,而成本约为其三分之一($0.39 对 $1.21);Fable 5 在 Brave 组的成绩仍在运行中。 其机制是“多样性采样 + 共识聚合”:多个模型独立完成搜索与推理、互相补位,弥补单一模型漏信息源、算错数值、顾不全约束的固有短板。用团队的话说:不是换一个更强的模型,而是换一种更好的组织方式。 这一结果指向一个正在成形的判断:国产基础模型单拎出来与海外旗舰仍有差距,但在 Harness 层组织得当的前提下,混用国产模型已能在真实任务上跑出更高、更稳的分数——即便面对最新一代旗舰,也能在成本只有零头的情况下咬住甚至反超。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-07-06原文

相关内容