toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI文章
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,441个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI文章
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策

DyRef 实操:给 Qwen 图像编辑模型补上多参考一致性,7 张图也不崩

2026/07/29
·toolin小编

哈工深 DyRef(ECCV 2026 Oral)是一套叠加在 Qwen-Image-Edit-2511 上的多参考一致性微调配方 + RL 动态奖励训练框架,最多 7 张参考图也能保持主体、姿势、风格一致。本篇教你本地跑通推理与可选的 SFT/RL 训练。

DyRef 实操:给 Qwen 图像编辑模型补上多参考一致性,7 张图也不崩
DyRef 实操:给 Qwen 图像编辑模型补上多参考一致性,7 张图也不崩
2026/07/29

DyRef 实操:给 Qwen 图像编辑模型补上多参考一致性,7 张图也不崩

哈工深 DyRef(ECCV 2026 Oral)是一套叠加在 Qwen-Image-Edit-2511 上的多参考一致性微调配方 + RL 动态奖励训练框架,最多 7 张参考图也能保持主体、姿势、风格一致。本篇教你本地跑通推理与可选的 SFT/RL 训练。

它解决了什么问题开源产物(全部 Apache-2.0,已逐一核实)开始前的准备第一步:创建 conda 环境第二步:拉取 LoRA 权重第三步:跑通多参考推理(最快上手)第四步(可选):Stage 1 SFT 监督微调第五步(可选):Stage 2 RL 强化学习(核心创新)验证结果常见问题
AI教程
所有文章

作者

avatar for toolin小编
toolin小编

分类

  • AI教程
它解决了什么问题开源产物(全部 Apache-2.0,已逐一核实)开始前的准备第一步:创建 conda 环境第二步:拉取 LoRA 权重第三步:跑通多参考推理(最快上手)第四步(可选):Stage 1 SFT 监督微调第五步(可选):Stage 2 RL 强化学习(核心创新)验证结果常见问题

相关文章

微信正式接入 OpenClaw:2 步配置你的专属 AI 助手
AI教程

微信正式接入 OpenClaw:2 步配置你的专属 AI 助手

微信官方推出 ClawBot 插件,支持直接在聊天界面调用 OpenClaw。本文提供完整配置教程,涵盖多平台接入方案。

avatar for toolin小编
toolin小编
2026/03/22
ClawGuard Auditor:给OpenClaw装上安全防护罩
AI产品

ClawGuard Auditor:给OpenClaw装上安全防护罩

北航团队开源OpenClaw安全防御工具,识别恶意Skill并输出审查报告,梳理9大高危风险及缓解措施

avatar for toolin小编
toolin小编
2026/03/21
EasySteer:比现有框架快22倍的LLM行为控制利器
AI产品

EasySteer:比现有框架快22倍的LLM行为控制利器

浙大开源EasySteer,基于vLLM的高性能LLM Steering框架,无需微调即可精准控制模型行为

avatar for toolin小编
toolin小编
2026/03/21

DyRef 是哈工大(深圳)朱涛涛课题组(第一作者 Wenwang Huang 等)发布的图像编辑训练框架,论文《Scaling Multi-Reference Image Generation with Dynamic Reward Optimization》(arXiv 2606.26947)已被 ECCV 2026 Oral 收录(2026-07-24 公布)。

它的切入点很具体:现有开源图像编辑模型(如 Qwen-Image-Edit-2511、FLUX.2-klein-base-9B)在你只给一张参考图时表现尚可,但一旦同时塞进多张扮演不同角色的参考图(主体人物 / 背景 / 姿势 / 光照 / 风格),就会出现"人物变了、姿势对不齐、风格漂移"。DyRef 就是来补这一刀的——最多可同时处理约 7 张不同角色的参考图。

先说清楚它是什么、不是什么:本站 2026-07-21 已发布 qwen-image-3(阿里千问第三代图像生成基座模型)。DyRef 不是新的基座模型,而是一个叠加在 Qwen-Image-Edit-2511 之上的「多参考一致性微调配方 + RL 动态奖励训练框架」——你可以把它理解为给开源图像编辑模型装上的一层"多参考约束插件"。这是它独立成篇的理由。

它解决了什么问题

把多张参考图喂给开源图像编辑模型,常见翻车场景:

  • 主体漂移:指定 A 的人物 + B 的背景,生成出来人物长相变了
  • 姿势对不齐:给了姿势参考图,最终姿势偏了 30 度
  • 风格串味:指定赛博朋克风格,输出却偏向写实

DyRef 用两阶段训练(SFT + RL)让模型在多参考约束下保持一致性,并在作者提出的 OmniRef-Bench(395 个专家标注样本、覆盖 5 种参考类型 × 10 种组合)上对标闭源 Nano Banana Pro、超过 Seedream 4.5。

开源产物(全部 Apache-2.0,已逐一核实)

产物地址说明
代码仓库github.com/Weistrass/DyRef含 sft/、rl/、model_inference/、benchmark/ 目录,318 stars
模型权重huggingface.co/Weistrass/Qwen-Image-Edit-2511-DyRefLoRA 权重
训练数据huggingface.co/datasets/Eason0438/OmniRef-training约 14K 样本即可完成训练
评测基准huggingface.co/datasets/Eason0438/OmniRef-Bench395 个多参考样本
论文arxiv.org/abs/2606.26947ECCV 2026 Oral

💡 提示:训练数据效率很高,仅约 14K 样本就能跑完整套 SFT+RL 流程,对显存和时间预算友好。

开始前的准备

  • 硬件:需要 NVIDIA GPU(PyTorch + CUDA 环境),训练阶段显存建议 24GB 以上
  • 账号:GitHub(拉代码)+ Hugging Face(拉权重和数据集)
  • 基座模型:Qwen-Image-Edit-2511(也支持 FLUX.2-klein-base-9B)
  • 预计时间:仅推理 10 分钟;完整 SFT+RL 训练视数据规模而定

第一步:创建 conda 环境

仓库为 SFT 和 RL 分别提供了独立环境配置(基于 Python 3.11),按你的目标选择。

只想用权重做推理(推荐入门读者)——只需 SFT 环境:

conda create -n dyref_sft python=3.11 -y
conda activate dyref_sft
cd DyRef/sft
pip install -e .

要跑完整 SFT + RL 训练——两个环境都要装:

# SFT 环境(同上)
conda create -n dyref_sft python=3.11 -y && conda activate dyref_sft && cd DyRef/sft && pip install -e .

# RL 环境(额外带 deepspeed)
conda create -n dyref_rl python=3.11 -y && conda activate dyref_rl && cd DyRef/rl && pip

💡 提示:RL 环境用 pip install -e .[deepspeed] 安装,因为 Stage 2 训练依赖 DeepSpeed 做分布式优化。

第二步:拉取 LoRA 权重

从 Hugging Face 拉取官方已发布的 LoRA 权重,放到本地指定路径(README 默认会从 HF Hub 自动下载,国内用户建议先手动下载到本地):

# 权重地址
# https://huggingface.co/Weistrass/Qwen-Image-Edit-2511-DyRef

这是叠加在 Qwen-Image-Edit-2511 基座之上的 LoRA 适配器,体积远小于完整模型权重。

第三步:跑通多参考推理(最快上手)

如果你只想体验"多参考图像编辑"的效果,不需要训练,直接跑官方提供的推理脚本:

conda activate dyref_sft
python model_inference/Qwen-Image-Edit-2511.py

这个脚本会加载基座 + LoRA 权重,接收多张参考图(主体/背景/姿势/光照/风格各角色),输出一张融合所有约束的合成图。建议先在 OmniRef-Bench 的 395 个样本里挑几个组合试跑,验证环境无误。

第四步(可选):Stage 1 SFT 监督微调

想在自己的多参考数据上微调,进入 SFT 阶段。官方提供了开箱即用的训练脚本:

cd DyRef/sft
bash all_scripts/Qwen-Image-Edit-2511_lora.sh

这一阶段在多参考数据上做 LoRA 微调,让模型先学会"听懂"多张参考图的约束。训练数据可直接用官方发布的 OmniRef-training(约 14K 样本),也可替换为你自己的多参考数据集。

第五步(可选):Stage 2 RL 强化学习(核心创新)

这是 DyRef 区别于普通 LoRA 微调的关键。Stage 2 用强化学习进一步优化,提出两个动态奖励机制:

  • DRS(Discriminative Reward Scaling,判别性奖励缩放)
  • DAR(Difficulty-aware Advantage Reweighting,难度感知优势重加权)

两者解决的是同一个痛点:RL 训练中奖励信号在简单样本和困难样本之间区分度不足——简单样本拿满分、困难样本全不及格,模型学不到对困难多参考组合的精细控制。DRS + DAR 让奖励信号在难度梯度上更"拉开",模型对困难组合学得更扎实。

跑官方 RL 脚本:

conda activate dyref_rl
cd DyRef/rl
bash scripts/qwen2511-gdpo-rank64-add2k5-csd-siglipv2_flat-sigmoid0.65-focal_loss.sh

脚本名里信息密度很高:rank64 是 LoRA 秩,siglipv2 是 reward 用的视觉编码器,sigmoid0.65 和 focal_loss 是 DAR 难度感知的实现细节。

验证结果

训练完成后,用 OmniRef-Bench 的测试集验证多参考一致性:

# 在 benchmark/ 目录下运行评测
cd DyRef/benchmark
# 官方 benchmark 脚本会跑 395 个样本、覆盖 5 种参考类型 × 10 种组合

成功标志:主体一致性(人物长相不漂移)、姿势对齐度、风格保真度三项指标相比基座 Qwen-Image-Edit-2511 明显提升,达到论文报告的"对标 Nano Banana Pro、超过 Seedream 4.5"水平。

常见问题

  • 显存不够怎么办:SFT 用 LoRA(已是默认配置)显存压力小;RL 阶段开启 DeepSpeed ZeRO-2/3 分片。入门用户建议先只跑第三步推理。
  • 没有自己的多参考数据:直接用官方 OmniRef-training(约 14K 样本)复现论文结果。
  • 想换基座模型:仓库同时支持 FLUX.2-klein-base-9B,参考 model_inference/ 目录下对应脚本。
  • 训练脚本名太长看不懂:那串参数其实是 DyRef 论文的核心超参(rank、sigmoid、focal_loss 等),改之前建议先读 RL 部分论文再动。
install
-e
.[deepspeed]