OpenSquilla 0.5.0 Preview 发布:多模型集成方案在 DRACO 榜单上以低成本登顶
OpenSquilla 用多国产模型集成,在 DRACO 榜单上以极低成本取得超越旗舰模型的分数,证明组织方式比模型本身更重要。
开源 AI Agent 项目 OpenSquilla 发布 0.5.0 Preview,核心是“多模型集成协作”:用 4 个国产模型(DeepSeek v4、GLM-5.2、Kimi K2.7、Qwen3.7)并行提案,再聚合输出。在 DRACO 榜单上,Brave Search 组平均分 64.09,比 GPT-5.5 高 20%,成本仅 $0.12,远低于对手;DuckDuckGo 组得分与 Anthropic 旗舰 Fable 5 持平,成本低三分之二。
正文摘录
开源 AI Agent 项目 OpenSquilla 近日发布 0.5.0 Preview 1,核心更新是 “多模型集成协作” (多模型 agentic routing):在 Harness 层把 4 个国产模型 DeepSeek v4、GLM-5.2、Kimi K2.7、Qwen3.7 组织成并行提案的协作队伍,再由 1 个模型聚合输出最终结果——阵容中没有任何一个海外旗舰模型。 与 Preview 同步,团队发布了《Agentic Routing》技术报告,阐述这套 harness 原生路由如何把日常 agent 流量转化为自我进化的数据飞轮;正式版本随后发布。 最新公布的 DRACO 深度研究榜单按搜索引擎分组对比各方案的平均分数与平均成本,OpenSquilla 的集成方案在两组均列第一。 Brave Search 组:平均分 64.09,高于单跑的 Opus 4.8(59.11, +8.42% )与 GPT-5.5(53.28, +20.27% ),平均任务成本 $0.12,分别低约 92% 与 86%,同组唯一同时拿下“最高分”与“最低成本”双标记。 DuckDuckGo 组:平均分 60.85,略高于 Anthropic 最新旗舰 Fable 5 的 59.80——分数基本持平,而成本约为其三分之一 ($0.39 对 $1.21);Fable 5 在 Brave 组的成绩仍在运行中。 其机制是“多样性采样 + 共识聚合”:多个模型独立完成搜索与推理、互相补位,弥补单一模型漏信息源、算错数值、顾不全约束的固有短板。用团队的话说:不是换一个更强的模型,而是换一种更好的组织方式。