Einsia AI 发布 PPTBench,评测 Coding Agent 的视觉编程能力
用 500 张论文流程图考 Coding Agent 能否「看图写 PPT」,并给出分层评测标准,用来量化视觉编程能力距离可用还有多远。
Coding Agent 正从纯文本任务走向把视觉目标转成代码。Einsia AI 旗下 Navers Lab 发布 PPTBench,用 500 个来自论文流程图的真实任务,考察 Agent 能否用代码把一张图重建成可编辑的 PPTX——既要看懂语义关系,也要写对几何布局,还要交付可解析的产物。
正文摘录
.jpg) Coding Agent 正在从屏幕里的终端世界走向屏幕外的物理世界。 过去,Agent 面对的主要是文本:给它一个任务,它通过调用工具、修改代码、运行测试,最终交付软件。整个过程,本质上都发生在字符串之间。 但如今,越来越多的任务开始将「 视觉世界本身作为输入 」。 一幅流程图、一张网页设计稿、一个 3D 场景草图,甚至一整页 PPT,都可以成为 Agent 需要理解并用代码重建的目标。于是,Coding Agent 正在面临一项新的考验: 「Visual Coding」—— 看懂一个视觉目标,并把它转化为可执行、可编辑的代码。 这看起来只是多了一层视觉输入,实际上却引入了一个全新的挑战:在保证代码能运行的基础上,Agent 必须还要从视觉输入中理解对象、结构、空间关系和语义,再把这些信息准确地编码进程序。 那么,如何才能既看清 Agent 在 Visual Coding 上走到了哪一步,又推动它继续向前? 一个好的测试载体,既要有足够丰富的视觉结构,又要能够被程序化地表达和编辑。 PPT 恰好满足了这两个条件 。一页 PPT 不是一张简单的图片,而是由文本、形状、连接线、分组和空间布局共同组成的可编辑对象集合。它既保留了视觉世界中的结构,又给出了一个天然的程序化表达空间。视觉上的相似,并不意味着语义上的正确。 一条箭头接错节点,流程关系就变了;一个小节点被漏掉,整个过程的含义也可能随之改变。