Hugging Face上新LLM代理基准LHTB,测试代理在终端长任务能力
RT @nathanhabib1011: Hugging Face 上的新基准测试
你最喜欢的 LLM 代理能写脚本。它能在终端中存活 300 多步而不迷失方向吗?
这就是 Long-Horizon Terminal-Bench (LHTB) 衡量的内容,46 个任务,抗污染,隐藏验证器检查真实状态,而不是凭感觉。
🏆 榜单
🥇 @MiniMax_AI 的 Minimax M3
🥈 @Kimi_Moonshot 的 Kimi k2.7 Code
🥉 @Zai_org 的 GLM 5.2
恭喜 @zli12321 和团队。非常期待 @0xSero 看看更小的本地模型在这个基准上的表现 :)
你最喜欢的 LLM 代理能写脚本。它能在终端中存活 300 多步而不迷失方向吗?
这就是 Long-Horizon Terminal-Bench (LHTB) 衡量的内容,46 个任务,抗污染,隐藏验证器检查真实状态,而不是凭感觉。
🏆 榜单
🥇 @MiniMax_AI 的 Minimax M3
🥈 @Kimi_Moonshot 的 Kimi k2.7 Code
🥉 @Zai_org 的 GLM 5.2
恭喜 @zli12321 和团队。非常期待 @0xSero 看看更小的本地模型在这个基准上的表现 :)