对比实验:不同 Agent 框架 Token 消耗最多差 30 倍
研究发现,智能体框架的选择比模型更能影响 Token 成本和速度,Claude Code 在同样任务中消耗最多 Token,成本可达其他框架的数倍。
Composio 团队用同一模型 Kimi K3 测试三个 Agent 框架(指用于运行 AI 智能体的工具链,如 Claude Code、Hermes、Kimi Code),完成相同 28 个任务。成功率相近,但 Token 消耗差距巨大:Claude Code 中位数消耗约 34 万 Token,是 Kimi Code(约 6.1 万)的 6 倍,单任务成本最高达 2 美元。
正文摘录
.jpg) 大家都说 Claude Code 浪费 Token,究竟有多费?这回终于有人算出数来了。 最近有个挺有意思的对比实验,来自 Composio 团队。他们用同一个模型 Kimi K3,分别放进三个不同的 agent 框架(harness)里跑 ——Claude Code、Hermes 和 Kimi Code—— 一共测了 28 个完全相同的任务。  结果,三个 harness 完成任务的成功率差不多:Kimi Code 是 28 个里成功 22 个,Hermes 是 21 个,Claude Code 是 20 个。差距不算大。 真正拉开差距的,是 token 消耗。 同样一个任务,用不同 harness 跑下来,token 用量最多能差到 30 倍! 中位数来看,Kimi Code 大约用 6.1 万 token,Hermes 大概 6.7 万,而 Claude Code 直接飙到 34 万,差不多是 Kimi Code 的 6 倍。