行业新闻

AI绘画实验:四模型临摹蒙娜丽莎均出现改过头现象

AI绘画实验:四模型临摹蒙娜丽莎均出现改过头现象

本实验揭示了大语言模型作为智能体在自主规划与自我评估中的局限性:它们往往在最好的时机过后过度调整,且成本与效果不成正比。

TryAI 让 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 用彩铅工具一笔一笔临摹蒙娜丽莎。所有模型都在中途达到最佳效果后继续修改导致降分。成本相差 20 倍(Sol 7.74 美元,Fable 5 160.58 美元),但高花费与画质无关。模型发展出截然不同的工作流:Sol 简洁高效,Grok 频繁调整工具但效果粗糙。实验开源,用于测试 AI 智能体的规划与自我评估能力。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimgdf30f5aab3.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-216.png) AI 第一次拿起彩铅画蒙娜丽莎,但发生了一件奇怪的事: 没有任何一个模型的最终作品,赢过它自己中途最好那版:它们总在最好的时候改过了头。 而且,同样是 7 幅画,成本相差了 20 倍! ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimgcc4dccc717.png) 最左为原作,其余四幅依次出自 GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash,全部一笔一笔画成。 AI 工具平台 TryAI 搭了一个「绘画竞技场」,只给模型一张纯白画布、一套彩铅工具,然后走开。 GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash 四个视觉模型下场,临摹蒙娜丽莎和梵高的星月夜,再加五道开放式文字命题,一共交出 28 幅画。 这不是文生图。整场实验里没有一张图片是「生成」出来的,每一笔的颜色、粗细、力度都由模型自己决定,一笔一笔叠上去。 7 月 21 日,TryAI 把这场实验的全部记录放了出来,同时也强调,这并非官方 benchmark,排名不是重点。 他们真正想测的不是模型的画技,而是它作为一个 AI 智能体,在没人盯着的几分钟里怎么规划、怎么调工具、怎么评估自己干出来的活。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-26原文

相关内容