ECCV'26 Oral深度解读:DyRef突破多参考图像生成难题

type
status
date
slug
summary
tags
category
icon
password
网址
给图像生成模型一张人物参考图,它大概率能抓住身份特征。
再给一张背景图,它也许还能把人放进去。
但如果一次给它5张、6张甚至7张不同类型的参考图:一个人物、一张背景、一种姿势、一种光照、一个风格,还要求它把这些信息组合成一张自然、统一、符合指令的新图呢?
问题就开始出现了。
模型可能记住了人物,却忘了姿势;套上了背景,却丢了风格;光照、构图、主体关系更容易互相“打架”。
这其实是当前图像生成走向专业应用时绕不开的问题。真实的设计工作很少只靠一句prompt或一张参考图完成。广告视觉、IP形象延展、海报设计、视频关键帧生成,往往都需要同时参考人物、场景、姿态、风格、光影等多种视觉条件。
也就是说,图像生成模型不只要“看懂一张图”,还要学会在多张参考图之间做协调。
针对这一问题,研究团队提出了DyRef,一个面向复杂多参考图像生成的动态优化框架。该工作已被ECCV 2026接收,并被选中为Oral Presentation。
论文提出的核心观察很直接:当前主流开源图像生成模型,在少量参考图场景下表现尚可;但随着参考图数量增加、参考类型组合变复杂,生成质量会明显下降。
△当参考图片的类型或数量一多时,开源模型往往难以根据指令保持所有对应参考源的内容一致性,性能会急剧下降。
多参考图像生成,不只是“多看几张图”
多参考图像生成听起来像是把多张图片一起塞给模型。
但真正难的地方在于,每张参考图承担的角色并不一样。
有的图提供主体身份,比如“这个人是谁”;有的图提供背景,比如“场景在哪里”;有的图提供姿势,比如“人物怎么站”;有的图提供光照,比如“整体明暗关系如何”;还有的图提供风格,比如“画面应该像水彩、电影海报还是复古摄影”。
对人类设计师来说,这是很自然的工作流:从不同素材里抽取不同视觉要素,再组合成新的画面。
但对生成模型来说,这是一场“多约束协同考试”。
如果模型只是粗略地把所有参考图混在一起,很容易出现信息冲突:主体身份被风格覆盖,姿势对齐失败,背景和人物比例不协调,或者干脆只听prompt、忽略部分参考图。
这也是DyRef想解决的问题:让开源图像生成模型在面对更复杂的参考图组合时,性能不至于随着条件变多而迅速下降。
△DyRef的在复杂多参考任务上的表现
先造一个更难的考场:OmniRef-Bench
团队首先发现,现有多参考图像生成benchmark还不够“难”。
很多评测只关注单主体、多主体,或者少量参考类型组合。它们能够测试模型是否能保留人物身份,却不一定能测试模型能否同时处理主体、背景、姿势、风格、光照等多种视觉约束。
于是,团队构建了OmniRef-Bench。这个benchmark包含395个专家标注样本,覆盖5类参考图类型:主体、背景、风格、光照、姿势。每个样本包含2到7张参考图,并覆盖10种不同参考类型组合,最多同时出现4类参考信息。
△(a)OmniRef-Bench的一部分测评样例展示。(b)OmniRef-Bench的参考类型组合以及对应的参考图片数量分布
更重要的是,OmniRef-Bench不是只依靠单一评估方式给生成结果打一个笼统分数。团队从客观量化指标和闭源模型打分两方面进行分析。
对于不同参考类型,它设计了更细粒度的评估维度。例如,主体要看身份一致性,背景要看场景匹配,风格要看视觉风格迁移,光照要看明暗关系,姿势要看动作是否对齐。
这让模型很难靠“画得好看”蒙混过关。
因为在复杂多参考任务里,画面好看只是第一步。更关键的是:该保留的参考信息有没有都保住。
DyRef:让模型别只会做“简单题”
为了解决这一问题,团队提出了DyRef。
DyRef的训练分为两步:
• 第一步,通过监督微调让模型先具备处理复杂多参考任务的基础能力。 • 第二步,引入强化学习,让模型进一步学会在复杂参考图组合中对齐不同视觉条件。
这里最关键的是,DyRef并不是把所有训练样本一视同仁。
复杂多参考任务里,不同样本难度差异很大。两张参考图的简单编辑,和七张参考图的混合约束,显然不是同一类题。
因此,DyRef设计了动态奖励优化机制:训练时更关注模型当前还做不好的复杂样本(DAR),同时把生成结果之间的优劣差距拉开(DRS),让模型更明确地知道哪些结果值得学习。
简单说,DyRef想做的不是让模型“多看几张图”,而是让模型真正学会:哪些参考信息该保留,哪些视觉条件该组合,以及当多种条件冲突时该如何协调。
△DyRef整体框架。
仅14K数据微调,使得开源模型复杂多参考能力和Nano Banana Pro相当,并超越Seedream4.5
在OmniRef-Bench上,DyRef显著提升了开源模型表现。在OmniRef-Bench的MLLM Evaluation平均分上,Qwen-Image-Edit-2511从4.97提升到8.38,明显缩小了与Nano Banana Pro的差距,并超过Seedream4.5的8.13。
尤其是在参考图数量更多、参考类型更复杂的任务中,DyRef有效缓解了原始模型性能下降的问题。
同时,在其他多参考图片生成测评基准MultiBanana和OmniContext上,DyRef相比于基线方法也同样取得提升。
△各方法在OmniRef-Bench上的结果
△各方法在OmniContext上的结果
△各方法在MultiBanana上的结果
多参考能力提升了,单图编辑也没有被牺牲
一个自然的问题是:模型专门练复杂多参考,会不会把原本的单图编辑能力练坏?
实验结果显示,DyRef没有出现这个问题。
在单图编辑测评基准ImgEdit和DreamBench++上,DyRef训练后的模型同样取得了提升。
也就是说,DyRef不仅增强了复杂多参考生成能力,也在一定程度上提升了模型对视觉条件和用户指令的整体理解能力。
△(a)DyRef和现有方法在OmniRef-Bench上的表现(b)DyRef和现有方法在单图编辑任务上的表现
论文标题:《Scaling Multi-Reference Image Generation with Dynamic Reward Optimization》论文链接:https://arxiv.org/pdf/2606.26947代码链接:https://github.com/Weistrass/DyRef
文章来自于"量子位",作者 "DyRef团队"。
Loading...

没有找到文章