GenEvolve:开源图像生成智能体通过工具编排实现自我进化
GenEvolve 让图像生成智能体学会自主调用搜索和参考图等工具,实现复杂需求的稳定输出,迈向更接近真实创作流程的开放任务。
GenEvolve 是一个让图像生成模型学会使用工具(搜索、参考图、生成知识)的智能体框架。它把一次生成立为多步决策,先理解需求,再调用外部工具获取证据,最后生成带约束的指令交给底层模型渲染,能更好地处理需要外部知识或视觉质量的复杂任务。
正文摘录
.jpg)  图像生成正在从「 一句话生成一张图」,走向更接近真实创作流程的开放任务。 在实际使用中,用户常常不只是给出一个 prompt:他可能要求画面对齐某个地标、人物、商品或事件,也可能要求参考图身份一致、材质特殊、或者要求模糊的描述也能表达清楚。面对这些需求,单靠生成模型一次前向推理很难稳定完成。 近期,来自香港科技大学(广州)、美团、香港科技大学、新加坡国立大学等机构的研究团队提出 GenEvolve,一个面向开放图像生成的自我进化智能体框架。它将一次生成建模为一「 工具编排轨迹」:智能体先理解请求,再调用搜索、图像检索和生成知识工具,最后把外部证据、视觉参考和硬约束整理成 prompt-reference program,交给不同底层生成器渲染。