AtomWorld 基准测试显示大模型原子操作能力不足,Scaling Law 遇边界
大模型能读懂材料知识,但不会动手操作原子;AtomWorld 揭示 Scaling Law 在三维空间任务上失效,科研智能体需要更多“行动”数据。
大模型在文本理解上很强,但在实际操作原子结构时频频翻车。AtomWorld 基准测试发现,模型规模增大只能提升简单规则任务,面对旋转、区域删除等三维空间操作,效果依然很差,说明 Scaling Law 在物理操作任务上不灵。研究提出需要“行动缩放定律”,让模型在科学操作中变强。
正文摘录
 新智元报道  【新智元导读】 大模型在原子操作任务中遭遇瓶颈。尽管大模型能解析材料知识,却难以精准操控原子结构。研究指出 Scaling Law 在空间逻辑任务中效果有限,强调 AI for Science 需转向 Action Scaling,提升模型在真实科研操作中的能力。 过去几年,大模型领域最成功的经验总结莫过于 Scaling Law(缩放定律) 。一个几乎被行业默认接受的共识是:只要模型足够大、数据足够多,能力就会持续涌现,甚至自动泛化到未知的领域。 但一项最新发布的材料学基准测试,却给这种「大力出奇迹」的乐观情绪带来了不一样的参考视角。 由中科大苏州高等研究院、新南威尔士大学等机构联合在 ICML 2026 发布的 AtomWorld,借助一系列真实原子操作任务得出结论:在文本理解、知识归纳等场景表现稳定有效的 Scaling Law,落地到受物理规则约束的原子实操任务时,往往达不到预期效果。