τ²-Bench Airline上线Eval Protocol,测试两模型得分
𝜏²-Bench Airline现已在Eval Protocol上线!我们使用两个开源模拟用户测试了gpt-oss-120b:
• Kimi-K2-Instruct → 42.15% ± 1.565(95%置信区间)
• GLM-4.5 → 45.85% ± 1.565(95%置信区间)
测试设置很重要——本例中,使用GLM-4.5可获得更高分数!
• Kimi-K2-Instruct → 42.15% ± 1.565(95%置信区间)
• GLM-4.5 → 45.85% ± 1.565(95%置信区间)
测试设置很重要——本例中,使用GLM-4.5可获得更高分数!