行业新闻

LiveClawBench:任务复杂度画像比领域更能解释AI Agent性能波动

三星等机构提出LiveClawBench,揭示AI Agent不稳定的主因是任务内部的复杂度因子,而非任务领域。

LiveClawBench是一个针对AI Agent的基准测试,包含134个真实个人助理任务。研究发现,任务领域只能解释约10%的性能波动,而任务的“复杂度画像”——例如跨服务协作或推断隐含目标——能解释近20%。这表明提升Agent稳定性的关键在于拆解任务本身的复杂性结构,而非仅关注领域知识。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/b2b63e4f-f010-43a2-9c1e-81bf4d5531aa/031(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 过去一年,三星在大模型领域显得格外活跃。 从持续加码 Foundation Model(基础模型)研发,到布局 Physical AI(物理 AI),再到持续推进 Galaxy AI 和多设备智能生态,三星正围绕 AI 重构其终端生态,并将 AI 打造成未来产品和服务的核心技术底座。近期,三星还进一步提出 Agentic AI 战略(一种强调自主行动的 AI 战略),将 AI Agent 从移动设备扩展至智能制造、智能家居等更广泛的智能基础设施,AI 已成为三星未来最重要的战略方向之一。 在这一背景下,三星大模型团队联合北京大学、香港城市大学、香港科技大学等科研机构,共同发布了面向 AI Agent 的基准测试 LiveClawBench(一种用于评估 AI Agent 在复杂真实任务中表现的标准测试集)。 不过,它关注的并不是「 谁的 Agent 更强」,而是一个更基础、也更关键的问题: 为什么同一个 AI Agent,在一些任务中已经接近可用,而在另一些任务中却会突然失稳? LiveClawBench 给出了一个更有意思的答案:任务领域并不能充分解释 Agent 的性能参差。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-03原文

相关内容