FreeStyle用社区LoRA数据与两阶段训练解耦图像风格与内容泄漏
FreeStyle通过挖掘社区LoRA数据和两阶段训练策略,有效分离了图像生成中的风格与内容,解决了内容泄漏问题。
FreeStyle研究的是'内容-风格双参考生成'(同时给定内容图和风格图,生成风格化内容图)中的内容泄漏问题——风格图里的主体被错误复制到结果。它从社区LoRA(轻量模型微调技术)中挖掘数据,构建了480K序列覆盖1704种风格的数据集,并采用两阶段训练:第一阶段用注意力约束减少模型对风格图的过度关注,第二阶段用频率调制抑制风格图局部位置对应。还开源了系统评估基准。
正文摘录
.jpg)  最近,一篇名为 FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining 的工作引起了不少关注。  arXiv 地址:https://arxiv.org/pdf/2606.20506 这篇文章关注的是一个非常实际的问题: 在图像生成中,如果同时给模型一张「内容参考图」和一张「风格参考图」,模型能不能既保留内容图中的主体结构,又学习风格图中的视觉风格,同时避免把风格图里的具体人物、物体或场景也一起复制过来?