CPI-Bench:一个全面、实用且智能的真实世界图像编辑基准
随着图像编辑模型的快速发展及其在各领域的广泛应用,将模型能力直接部署到真实场景的需求日益迫切。然而,现有基准仍局限于简单的单图任务,覆盖维度有限,难以有效区分不同模型的性能差异,因此无法可靠评估模型在复杂多图编辑、高推理需求指令及实际部署场景中的表现。 针对上述局限,我们提出 CPI-Bench,一个面向真实世界图像编辑的全面、实用且智能的基准。CPI-Bench 包含三个核心子集:CPI-General-Bench 全面覆盖多样编辑任务,并首创性地纳入多图像编辑评估;CPI-Practical-Bench 聚焦高频真实用户应用场景;CPI-Intelligent-Bench 专门评估高推理需求编辑能力。基于 CPI-Bench 对主流图像编辑模型的评测结果表明,该基准增强了模型间的性能区分度,能够全面、可靠地量化通用编辑能力、实际部署效能及高级推理编辑方面的差距,为图像编辑模型的未来优化提供了宝贵指导。 关键的是,我们的排名分析显示,CPI-Bench 与 Arena Image Edit Leaderboard 的对齐度最高,表明其能忠实反映人类评估者的偏好与感知判断,可作为真实用户体验的可靠代理。
论文精读
TL;DR CPI-Bench 提出首个覆盖多图编辑、实用高频场景与推理式指令的综合图像编辑基准,显著提升模型区分度,且与 Arena Image Edit Leaderboard 高度对齐,更真实反映人类偏好。
问题
问题背景
当前图像编辑模型从简单生成快速转向真实世界复杂任务,业界需要基准来评估模型在实用场景中的真实能力,而非仅学术指标。
现有方法局限
- 现有基准如
EditBench、MagicBrush等主要覆盖单图编辑,缺少对多图编辑(多图一致性、关系保持)的评估。 - 任务指令多为简单描述,不包含推理型指令(如空间关系、隐含意图),无法测试模型的高阶理解能力。
- 评测维度单一,难以区分不同模型之间的细微性能差异,导致排行榜分数拥挤,无法指导模型选型。
为什么这个问题难/重要
- 多图编辑要求模型同时维护多张图像的语义一致性、几何变换和对象关联,技术难度远超单图编辑。
- 推理式编辑需要模型将自然语言指令解析为可执行的编辑操作,涉及视觉-语言联合推理,是当前多模态模型的核心挑战。
- 真实用户高频场景(如电商商品图、海报合成)与学术数据集存在分布偏移,现有基准无法反映部署效果。
- 业界关注人类偏好对齐:若基准排名与真实用户评价不一致,会导致模型优化方向偏差。
行业类比
这类似于自动驾驶评测从封闭场地测试扩展到真实城市道路测试:需要覆盖复杂交互、长尾场景,并确保自动评测与人类驾驶体验高度一致。
核心洞察
- CPI-Bench 首次将多图像编辑纳入标准化评估,填补了现有图像编辑基准仅覆盖单图任务的空白。这一设计使基准能反映真实工作流中多图引用、条件合成、风格迁移等复杂场景,而 EditBench、MagicBrush 等已有基准仅聚焦单图指令,无法区分模型在多图协同编辑中的能力差异。对实际工程而言,多图编辑能力直接影响产品在电商、设计等场景的落地效率,该基准为这类能力提供了量化标尺。
- CPI-Bench 划分出独立的推理型编辑子集(CPI-Intelligent-Bench),将评估从低阶像素操作提升到高阶语义理解与逻辑执行。与简单指令编辑不同,推理编辑要求模型解析复合条件、空间关系、抽象意图,这与真实用户复杂需求更接近。同时,CPI-Bench 与 Arena Image Edit Leaderboard 对齐度最高,说明该基准能可靠代理人类偏好,可作为模型选型与上线前的快速筛选工具,降低人工评测成本。
方法
输入与任务定义
CPI-Bench 的输入为真实用户图像编辑请求,覆盖单图、多图及交错的图文指令。每个样本包含源图像、编辑指令文本,以及可选的多张参考图像。任务类型从简单局部编辑到复杂多图合成与逻辑推理编辑,指令直接来源于真实高频应用场景,确保分布贴近实际部署。
三个关键子集构建
- CPI-General-Bench:系统覆盖颜色、纹理、几何变换、物体增删、背景替换等通用编辑类型,并首次纳入多图像编辑任务,评估模型跨图像关联与一致性处理能力。
- CPI-Practical-Bench:聚焦高频实用场景,如商品图优化、人像修复、风格转换等,指令贴近终端用户日常操作,强调模型在真实应用中的稳定性与输出质量。
- CPI-Intelligent-Bench:面向需要推理的编辑指令,例如根据空间关系、属性约束或隐含语义执行修改,测试模型理解复杂图文指令并转化为像素级操作的能力。
输出与评估流程
将三个子集的样本输入主流图像编辑模型,生成编辑结果。评估采用多维度指标,包括编辑指令遵从度、图像质量保持、多图一致性等,并最终汇总为各模型在通用、实用、推理三个维度的分数与排名。同时,通过与 Arena Image Edit Leaderboard 的对齐分析,验证基准对真实人类偏好的拟合程度。
与同类方法差异:现有基准普遍局限于单图简单编辑且维度单一,CPI-Bench 首次系统性引入多图编辑和推理型指令,并以人类偏好对齐作为核心效度证据,而非仅依赖自动化指标。
实验
实验设计
CPI-Bench 通过三个子集评估主流图像编辑模型:CPI-General-Bench 覆盖多图像编辑和多样化任务,CPI-Practical-Bench 聚焦高频真实用户场景,CPI-Intelligent-Bench 侧重推理型编辑。评估模型包括 GPT-Image2、Nano Banana Pro 等。关键指标为模型区分度和与 Arena Image Edit Leaderboard 的排名对齐度。
关键发现
- CPI-Bench 显著提升了模型间性能区分度,现有基准难以区分的模型在 CPI-Bench 上呈现明显差异。
- 三个子集分别暴露模型在通用编辑、实用部署和推理能力上的短板,提供精细优化信号。
- 排名分析显示 CPI-Bench 与 Arena Image Edit Leaderboard 对齐度最高,表明其能忠实捕捉人类评估者的偏好,可作为真实用户体验的稳健代理。
与基线对比
现有基准局限于单图简单任务,覆盖维度有限且无法有效区分模型,导致评估结果不可靠。CPI-Bench 通过引入多图像编辑、实用高频场景和推理密集型指令,系统性扩展了评估边界,更贴近真实世界部署需求。与 Arena 人类偏好基准的高度对齐,验证了其作为自动化评估指标的可靠性,为图像编辑模型优化提供了明确方向。
行业影响
落地场景
CPI-Bench 面向真实图像编辑任务,适用于需要大规模生成或编辑图像的业务场景。例如:
- 电商平台:商品图批量更换背景、多商品图片合成、模特换装等编辑流程,可通过该基准筛选更适合多图编辑与复杂指令的模型。
- 内容创作平台:视频封面、海报生成、多图融合等创意工具,需评估模型对推理型指令的理解与执行能力。
商业价值
- 降本:通过基准自动筛选高性能模型,减少人工审核与重试成本;在生产环境中替换低效模型可直接降低推理开销。
- 增收/体验提升:更精准的编辑能力提升内容生成质量,缩短素材生产周期,提高用户留存与转化;对模型迭代的量化指导加速产品上线。
与现有产品/工作流的接口
- 将 CPI-Bench 作为离线评测模块,集成到模型选型与 CI/CD 流程中,每次模型更新跑分并与基线对比。
- 结合 Arena Image Edit Leaderboard 的在线人类偏好数据,在离线阶段提前预判用户体验,减少 A/B 测试盲区。
- 支持自定义子集权重,针对特定业务场景(如电商 vs 设计)调整
General/Practical/Intelligent比例,实现按需评测。
局限
- **规模与多样性局限**:CPI-Bench 子集规模未在论文摘要中明确披露,从开源仓库初期数据推断,样本量可能有限,尤其 **CPI-Intelligent-Bench** 的推理指令生成依赖人工模板或特定场景,难以覆盖真实用户复杂多变的编辑需求。与大型通用图像编辑基准相比,其任务广度和数据多样性仍有待扩充,这会影响评分稳健性和模型排名的泛化能力。
- **评估指标与自动化偏差**:论文强调与 Arena Image Edit Leaderboard 的高度对齐,但该对齐受 Arena 用户群体偏好和主观判断影响,存在采样偏差。若采用自动化指标(如 GPT-4V 评分)或混合人类评分,自动化指标与人类感知之间的差距未充分消融,可能导致对风格化、局部细节等编辑类型的评价失真,难以完全替代真实人类评估。
- **多图编辑与推理深度局限**:CPI-Bench 率先引入多图编辑,但可能仅支持双图或固定数量图像,缺乏对更多图像、跨图像长期依赖、主体一致性保持的系统评估;**CPI-Intelligent-Bench** 的高要求推理编辑可能侧重文本理解,对复杂空间推理、因果关系或世界知识要求的覆盖不足,仍需扩展以逼近真实世界高难度编辑任务。