行业新闻

AtomWorld 基准测试显示大模型原子操作能力不足,Scaling Law 遇边界

AtomWorld 基准测试显示大模型原子操作能力不足,Scaling Law 遇边界

大模型能读懂材料知识,但不会动手操作原子;AtomWorld 揭示 Scaling Law 在三维空间任务上失效,科研智能体需要更多“行动”数据。

大模型在文本理解上很强,但在实际操作原子结构时频频翻车。AtomWorld 基准测试发现,模型规模增大只能提升简单规则任务,面对旋转、区域删除等三维空间操作,效果依然很差,说明 Scaling Law 在物理操作任务上不灵。研究提出需要“行动缩放定律”,让模型在科学操作中变强。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3629e3652f.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-119.png) 【新智元导读】 大模型在原子操作任务中遭遇瓶颈。尽管大模型能解析材料知识,却难以精准操控原子结构。研究指出 Scaling Law 在空间逻辑任务中效果有限,强调 AI for Science 需转向 Action Scaling,提升模型在真实科研操作中的能力。 过去几年,大模型领域最成功的经验总结莫过于 Scaling Law(缩放定律) 。一个几乎被行业默认接受的共识是:只要模型足够大、数据足够多,能力就会持续涌现,甚至自动泛化到未知的领域。 但一项最新发布的材料学基准测试,却给这种「大力出奇迹」的乐观情绪带来了不一样的参考视角。 由中科大苏州高等研究院、新南威尔士大学等机构联合在 ICML 2026 发布的 AtomWorld,借助一系列真实原子操作任务得出结论:在文本理解、知识归纳等场景表现稳定有效的 Scaling Law,落地到受物理规则约束的原子实操任务时,往往达不到预期效果。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-15原文

相关内容