研究:顶级AI在《文明VI》中计划执行率不足一半,核平后仍输
AI在复杂策略游戏中暴露了感知盲区和知行差距,说明单纯提升智力无法解决执行与全局感知的短板。
英国前数据科学家将Claude、GPT等四大AI接入《文明VI》,进行23场对局。AI虽能考99.26分,但治国时暴露两大问题:主动检查全局状态的感知行为仅占1-2%;写下计划后10回合内执行率最低仅48.2%。一局中Claude为阻止法国文化胜利,花50回合造核弹摧毁对方城市,却因忽略外交分而输掉比赛。
正文摘录
 新智元报道  【新智元导读】 四大顶级大模型被丢进《文明6》,反手就花 50 回合造核弹把法国夷为平地,最后却连怎么输的都不知道。 太魔幻了! 就在最近,英国前首相府数据科学家 Liam Wilkinson,花一个周末搭了 76 个 MCP 工具,把 Claude、GPT、Gemini 等四个顶尖模型扔进了《文明 VI》。 结果,23 场对局打完,其中一个 AI 造了核弹炸了法国——然后输了。   一群 AI,被丢进了「文明 VI」里 Wilkinson 在唐宁街 10 号做数据科学家的时候,给 AI 出了一套考题:GovBench,3497 道英国政府相关选择题,覆盖政策、法规、行政流程。 GPT-5 考了 99.26 分。 满分级选手。但治国不是知识竞赛。一个能背下所有政策文件的人,丢到唐宁街真能治国吗? 选择题测不出来的东西太多了:多线程决策、资源分配、长期规划、在不完整信息下做判断。 他需要一个不一样的考场。然后他想到了《文明 VI》。