测试Qwen 3 Coder在OpenRouter上的工具调用性能
这是对OpenRouter上Qwen 3 Coder进行工具调用测试的*早期*运行。运行时存在差异,后续需要平滑处理。
我所测试的内容:
• AI模型实际使用工具的能力
• 在长消息链中测试真正的原生工具调用
• 测试模型是否以正确的参数调用正确的工具
关键指标:
• 工具召回率:是否调用了应该调用的工具?(越高越好)
• 工具精确率:调用的工具是否确实需要?(越高越好)
• 参数准确性:是否使用了正确的值?(越高越好)
• 场景成功率:完整工作流是否实际有效?(越高越好)
最终得分计算:
• 结合5个指标:场景成功率 + 工具F1 + 参数准确性(结构)+ 参数准确性(语义)+ 执行成功率
• 每个指标等权重,平均转换为0-100%
• A+ = 90%+, A = 85%+, B = 70%+
结果显示提供商之间差异巨大,但再次提醒会有几个百分点的运行时差异,不过这很酷,现在将其与我的tps测试配对。我认为我们可以开始客观地找出应该使用哪个提供商。
成本是接下来要解决的问题之一。
另外,抱歉没有排序,但你可以看到@cerebras和阿里巴巴的得分实际上非常接近。我有详细的细分数据。
最后一点:我在考虑是否也要做模拟工具调用(基于提示的工具调用)。
我所测试的内容:
• AI模型实际使用工具的能力
• 在长消息链中测试真正的原生工具调用
• 测试模型是否以正确的参数调用正确的工具
关键指标:
• 工具召回率:是否调用了应该调用的工具?(越高越好)
• 工具精确率:调用的工具是否确实需要?(越高越好)
• 参数准确性:是否使用了正确的值?(越高越好)
• 场景成功率:完整工作流是否实际有效?(越高越好)
最终得分计算:
• 结合5个指标:场景成功率 + 工具F1 + 参数准确性(结构)+ 参数准确性(语义)+ 执行成功率
• 每个指标等权重,平均转换为0-100%
• A+ = 90%+, A = 85%+, B = 70%+
结果显示提供商之间差异巨大,但再次提醒会有几个百分点的运行时差异,不过这很酷,现在将其与我的tps测试配对。我认为我们可以开始客观地找出应该使用哪个提供商。
成本是接下来要解决的问题之一。
另外,抱歉没有排序,但你可以看到@cerebras和阿里巴巴的得分实际上非常接近。我有详细的细分数据。
最后一点:我在考虑是否也要做模拟工具调用(基于提示的工具调用)。