行业新闻

复旦与 Wan 团队发布首篇 Agentic 视觉生成综述,提出 L0-L4 控制分级框架

这篇综述用 L0-L4 分级回答一个具体问题:视觉生成系统里控制器能自主决定到哪一步,并指出目前多数工作只做到当前任务内的结果修正,跨任务复用经验仍是少数。

让 AI 生成一张海报已不困难,难的是让它围绕同一设计目标持续工作:理解需求、出初稿、发现问题后知道改哪里,并保留已确认的内容。复旦、Wan 与港中文 MMLab 的综述把 300 多份工作按控制器的决策范围分成 L0 到 L4 四级,梳理图像、视频、幻灯片、3D 等生成系统在生成前、执行中、看到结果后以及任务结束后分别能做什么决定。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/f96f7105-4790-4912-bb50-7260a661beb9/077(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 让 AI 生成一张海报已经不难。更难的是,让它围绕同一个设计目标持续工作:理解品牌与产品要求,生成初稿;发现标题、产品位置或整体风格存在问题后,知道应该修改哪里、怎样修改;同时保留已经确认的内容。等到下一次活动,它还能延续此前确定的设计偏好和有效经验。 这里需要做的决定,从曾经的“输入什么提示词”,扩展到了选什么工具、检查结果、局部修改,以及积累经验。 这些决定由谁来做,做到哪一步,正是 Agentic Visual Generation(智能体式视觉生成) 要研究的问题。 来自 复旦、Wan、港中文 mmlab 的研究团队在综述《Agentic Visual Generation: From Generative Models to Agentic Control》中,为这个快速发展的方向建立了一套围绕控制器决策范围的分类框架。 论文梳理了覆盖图像生成、编辑、视频、幻灯片、用户界面、3D 与世界模型 的系统,并将不同技术路线放到同一组问题下考察:系统在生成前能决定什么?执行时能选择什么?看到结果后能改变什么?任务结束后又能留下什么?

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-22原文

相关内容