哈工深 DyRef(ECCV 2026 Oral)是一套叠加在 Qwen-Image-Edit-2511 上的多参考一致性微调配方 + RL 动态奖励训练框架,最多 7 张参考图也能保持主体、姿势、风格一致。本篇教你本地跑通推理与可选的 SFT/RL 训练。


哈工深 DyRef(ECCV 2026 Oral)是一套叠加在 Qwen-Image-Edit-2511 上的多参考一致性微调配方 + RL 动态奖励训练框架,最多 7 张参考图也能保持主体、姿势、风格一致。本篇教你本地跑通推理与可选的 SFT/RL 训练。
北航团队开源OpenClaw安全防御工具,识别恶意Skill并输出审查报告,梳理9大高危风险及缓解措施
DyRef 是哈工大(深圳)朱涛涛课题组(第一作者 Wenwang Huang 等)发布的图像编辑训练框架,论文《Scaling Multi-Reference Image Generation with Dynamic Reward Optimization》(arXiv 2606.26947)已被 ECCV 2026 Oral 收录(2026-07-24 公布)。
它的切入点很具体:现有开源图像编辑模型(如 Qwen-Image-Edit-2511、FLUX.2-klein-base-9B)在你只给一张参考图时表现尚可,但一旦同时塞进多张扮演不同角色的参考图(主体人物 / 背景 / 姿势 / 光照 / 风格),就会出现"人物变了、姿势对不齐、风格漂移"。DyRef 就是来补这一刀的——最多可同时处理约 7 张不同角色的参考图。
先说清楚它是什么、不是什么:本站 2026-07-21 已发布 qwen-image-3(阿里千问第三代图像生成基座模型)。DyRef 不是新的基座模型,而是一个叠加在 Qwen-Image-Edit-2511 之上的「多参考一致性微调配方 + RL 动态奖励训练框架」——你可以把它理解为给开源图像编辑模型装上的一层"多参考约束插件"。这是它独立成篇的理由。
把多张参考图喂给开源图像编辑模型,常见翻车场景:
DyRef 用两阶段训练(SFT + RL)让模型在多参考约束下保持一致性,并在作者提出的 OmniRef-Bench(395 个专家标注样本、覆盖 5 种参考类型 × 10 种组合)上对标闭源 Nano Banana Pro、超过 Seedream 4.5。
| 产物 | 地址 | 说明 |
|---|---|---|
| 代码仓库 | github.com/Weistrass/DyRef | 含 sft/、rl/、model_inference/、benchmark/ 目录,318 stars |
| 模型权重 | huggingface.co/Weistrass/Qwen-Image-Edit-2511-DyRef | LoRA 权重 |
| 训练数据 | huggingface.co/datasets/Eason0438/OmniRef-training | 约 14K 样本即可完成训练 |
| 评测基准 | huggingface.co/datasets/Eason0438/OmniRef-Bench | 395 个多参考样本 |
| 论文 | arxiv.org/abs/2606.26947 | ECCV 2026 Oral |
💡 提示:训练数据效率很高,仅约 14K 样本就能跑完整套 SFT+RL 流程,对显存和时间预算友好。
仓库为 SFT 和 RL 分别提供了独立环境配置(基于 Python 3.11),按你的目标选择。
只想用权重做推理(推荐入门读者)——只需 SFT 环境:
conda create -n dyref_sft python=3.11 -y
conda activate dyref_sft
cd DyRef/sft
pip install -e .要跑完整 SFT + RL 训练——两个环境都要装:
# SFT 环境(同上)
conda create -n dyref_sft python=3.11 -y && conda activate dyref_sft && cd DyRef/sft && pip install -e .
# RL 环境(额外带 deepspeed)
conda create -n dyref_rl python=3.11 -y && conda activate dyref_rl && cd DyRef/rl && pip💡 提示:RL 环境用
pip install -e .[deepspeed]安装,因为 Stage 2 训练依赖 DeepSpeed 做分布式优化。
从 Hugging Face 拉取官方已发布的 LoRA 权重,放到本地指定路径(README 默认会从 HF Hub 自动下载,国内用户建议先手动下载到本地):
# 权重地址
# https://huggingface.co/Weistrass/Qwen-Image-Edit-2511-DyRef这是叠加在 Qwen-Image-Edit-2511 基座之上的 LoRA 适配器,体积远小于完整模型权重。
如果你只想体验"多参考图像编辑"的效果,不需要训练,直接跑官方提供的推理脚本:
conda activate dyref_sft
python model_inference/Qwen-Image-Edit-2511.py这个脚本会加载基座 + LoRA 权重,接收多张参考图(主体/背景/姿势/光照/风格各角色),输出一张融合所有约束的合成图。建议先在 OmniRef-Bench 的 395 个样本里挑几个组合试跑,验证环境无误。
想在自己的多参考数据上微调,进入 SFT 阶段。官方提供了开箱即用的训练脚本:
cd DyRef/sft
bash all_scripts/Qwen-Image-Edit-2511_lora.sh这一阶段在多参考数据上做 LoRA 微调,让模型先学会"听懂"多张参考图的约束。训练数据可直接用官方发布的 OmniRef-training(约 14K 样本),也可替换为你自己的多参考数据集。
这是 DyRef 区别于普通 LoRA 微调的关键。Stage 2 用强化学习进一步优化,提出两个动态奖励机制:
两者解决的是同一个痛点:RL 训练中奖励信号在简单样本和困难样本之间区分度不足——简单样本拿满分、困难样本全不及格,模型学不到对困难多参考组合的精细控制。DRS + DAR 让奖励信号在难度梯度上更"拉开",模型对困难组合学得更扎实。
跑官方 RL 脚本:
conda activate dyref_rl
cd DyRef/rl
bash scripts/qwen2511-gdpo-rank64-add2k5-csd-siglipv2_flat-sigmoid0.65-focal_loss.sh脚本名里信息密度很高:rank64 是 LoRA 秩,siglipv2 是 reward 用的视觉编码器,sigmoid0.65 和 focal_loss 是 DAR 难度感知的实现细节。
训练完成后,用 OmniRef-Bench 的测试集验证多参考一致性:
# 在 benchmark/ 目录下运行评测
cd DyRef/benchmark
# 官方 benchmark 脚本会跑 395 个样本、覆盖 5 种参考类型 × 10 种组合成功标志:主体一致性(人物长相不漂移)、姿势对齐度、风格保真度三项指标相比基座 Qwen-Image-Edit-2511 明显提升,达到论文报告的"对标 Nano Banana Pro、超过 Seedream 4.5"水平。
model_inference/ 目录下对应脚本。