行业新闻

研究:顶级AI在《文明VI》中计划执行率不足一半,核平后仍输

研究:顶级AI在《文明VI》中计划执行率不足一半,核平后仍输

AI在复杂策略游戏中暴露了感知盲区和知行差距,说明单纯提升智力无法解决执行与全局感知的短板。

英国前数据科学家将Claude、GPT等四大AI接入《文明VI》,进行23场对局。AI虽能考99.26分,但治国时暴露两大问题:主动检查全局状态的感知行为仅占1-2%;写下计划后10回合内执行率最低仅48.2%。一局中Claude为阻止法国文化胜利,花50回合造核弹摧毁对方城市,却因忽略外交分而输掉比赛。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimg57120d1b6d.jpg) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimg3b253ef414-271.png) 【新智元导读】 四大顶级大模型被丢进《文明6》,反手就花 50 回合造核弹把法国夷为平地,最后却连怎么输的都不知道。 太魔幻了! 就在最近,英国前首相府数据科学家 Liam Wilkinson,花一个周末搭了 76 个 MCP 工具,把 Claude、GPT、Gemini 等四个顶尖模型扔进了《文明 VI》。 结果,23 场对局打完,其中一个 AI 造了核弹炸了法国——然后输了。 ![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimgbfe0c1a13f.png) ![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimgdf9d89c9b2-267.png) 一群 AI,被丢进了「文明 VI」里 Wilkinson 在唐宁街 10 号做数据科学家的时候,给 AI 出了一套考题:GovBench,3497 道英国政府相关选择题,覆盖政策、法规、行政流程。 GPT-5 考了 99.26 分。 满分级选手。但治国不是知识竞赛。一个能背下所有政策文件的人,丢到唐宁街真能治国吗? 选择题测不出来的东西太多了:多线程决策、资源分配、长期规划、在不完整信息下做判断。 他需要一个不一样的考场。然后他想到了《文明 VI》。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-06-29原文

相关内容