VISTA 基准发布:首个持续更新视觉规范到应用评测平台
VISTA 评测基准让 AI 从 Figma 设计稿开发整个网页应用,排行榜显示顶尖模型综合得分不足 0.3,产品级开发仍是挑战。
科学家推出 VISTA 评测基准,要求 AI 编程助手根据产品需求和 Figma 设计稿从零开发完整网页应用,不再只是修复代码。排行榜持续更新,当前最高分不足 0.3,显示 AI 距离稳定开发产品还有差距。
正文摘录
.jpg)  近年来,Coding Agent 正以前所未有的速度发展。从 Claude Code、OpenAI Codex 到 Cursor、Gemini CLI,大语言模型已经能够自主完成编码、调试、运行甚至部署整个 Web 应用,「AI 软件工程师」正逐渐成为现实。然而,一个新的问题也随之出现: 如果不给 AI 一个 GitHub Issue,而是给它一张 Figma 设计稿,它还能开发出一个真正可以交付的产品吗? 过去几年,SWE-bench、OpenHands 等 Benchmark 极大推动了 Coding Agent 的发展,但它们主要关注代码仓库维护和 GitHub Issue 修复。相比之下,真实的软件开发通常始于一份产品需求(PRD)和一张 Figma 设计稿,需要开发者从零构建完整的 Web 应用。这意味着,Coding Agent 面临的挑战已经从 Code Generation 逐渐演进为 Product Generation。然而,目前仍然缺少一个能够系统评测这一能力的公开 Benchmark。