火思动力开源 PyroDash:小模型按需调用大模型,推理成本降至三十分之一
PyroDash 用 token 级协同推理让 4B 小模型自己决定何时把活交给大模型,成本降到三十分之一,准确率甚至能反超纯大模型方案,是「Agent 蜂群」路线的一次工程验证。
顶级大模型的调用价格是 4B 小模型的上千倍,账单越来越贵怎么办?火思动力开源的 PyroDash 让可训练的小模型先独立作答,只在判断自己接不住时吐出一个控制 token,把已经写了一部分的推理轨迹交给冻结的大模型接着写完。在五个数学推理基准上,省钱模式把总成本从 49.36 美元压到 1.78 美元,准确度基本不掉。
正文摘录
.jpg) 编辑|Panda 如今的顶级 AI 确实强大,新成果接连不断,尤其是在数学领域,甚至还攻克了一个千禧年问题。当然,这有些争议,但确实强。 然而,顶级 AI 也不便宜:Astra API 标准价为每百万 token 输入 10 美元、输出 50 美元;Fast 模式按适用费率的 2 倍计费。若单次请求输入超过 27.2 万 token,则整个请求将按长上下文价格计费,输入价格翻倍至 20 美元/百万 token,输出价格则上涨至 75 美元/百万 token!  作为对照,本文后面还会提到的一个 4B 小模型的输出价格可低至 0.08 美元,与顶级 AI 相差成百上千倍。 能力的天花板一路抬升,调用它的单价也不遑多让。于是问题来了:面对日益膨胀的账单,我们该怎么办? 火思动力(Pyromind)近期开源的 PyroDash 给了一个有点反直觉的答案: 让小模型自己来决定什么时候该呼叫大模型 。