行业新闻

VISTA 基准发布:首个持续更新视觉规范到应用评测平台

VISTA 评测基准让 AI 从 Figma 设计稿开发整个网页应用,排行榜显示顶尖模型综合得分不足 0.3,产品级开发仍是挑战。

科学家推出 VISTA 评测基准,要求 AI 编程助手根据产品需求和 Figma 设计稿从零开发完整网页应用,不再只是修复代码。排行榜持续更新,当前最高分不足 0.3,显示 AI 距离稳定开发产品还有差距。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/b5f1d4b1-70ae-42f5-ac7c-f84d1d904555/033(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsg&tp=webp&wxfrom=5&wxlazy=1imgIndex=0) 近年来,Coding Agent 正以前所未有的速度发展。从 Claude Code、OpenAI Codex 到 Cursor、Gemini CLI,大语言模型已经能够自主完成编码、调试、运行甚至部署整个 Web 应用,「AI 软件工程师」正逐渐成为现实。然而,一个新的问题也随之出现: 如果不给 AI 一个 GitHub Issue,而是给它一张 Figma 设计稿,它还能开发出一个真正可以交付的产品吗? 过去几年,SWE-bench、OpenHands 等 Benchmark 极大推动了 Coding Agent 的发展,但它们主要关注代码仓库维护和 GitHub Issue 修复。相比之下,真实的软件开发通常始于一份产品需求(PRD)和一张 Figma 设计稿,需要开发者从零构建完整的 Web 应用。这意味着,Coding Agent 面临的挑战已经从 Code Generation 逐渐演进为 Product Generation。然而,目前仍然缺少一个能够系统评测这一能力的公开 Benchmark。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-06原文

相关内容