UniRL:Tencent Hunyuanがオープンソース化するマルチモーダルRL訓練フレームワーク

·Toolin 編集部

Tencent Hunyuanの龐天宇チームがUniRLをオープンソース化。1つのフレームワークで画像、動画、LLMなどマルチモーダル生成モデルの強化学習訓練を統一し、SD3、HunyuanVideo、Qwenなどの主要モデルに対応します。

UniRL:Tencent Hunyuanがオープンソース化するマルチモーダルRL訓練フレームワーク

UniRLは、Tencent Hunyuanチーム(龐天宇チーム)がオープンソース化した、マルチモーダル生成モデルの強化学習ポストトレーニングフレームワークです。長年の痛点を解決します:画像拡散モデルには1セットの訓練フロー、動画生成には別の標準、VLMとLLMにはまた異なる技術スタック、という状態を。UniRLはこれらをすべて1つのフレームワークに統一します。

解決する問題

マルチモーダル生成モデルのRL訓練は、4つの課題に直面しています:

  1. 生成過程が異なる:LLMは離散トークン系列を処理し、画像/動画生成は連続潜在空間でのノイズ除去軌跡に対応する。統一モデルの1回のrolloutでは、トークン生成とlatentノイズ除去が混在することもある。

  2. システムのクローズドループを安定させにくい:rollout、log-prob replayとポリシー更新は複数のモデルとバックエンドにまたがり、訓練側ではサンプリング側の条件、ノイズ、タイムステップを厳密に再現しなければならず、さもないとTraining-Inference Mismatchが発生する。

  3. 報酬システムがより重い:マルチモーダルrewardはしばしばVLM、OCR、美学モデル、動画理解モデルに依存し、単純なテキストルールではない。

  4. GPUメモリの圧力が大きい:中間生成物は高次元のlatent、ノイズ、タイムステップと条件状態であり、動画生成では解像度とフレーム数に伴って急速に増大する。

このため、業界の現状は「1モデルにつき1セットの訓練コード」で、開発者は大量の時間を重複したエンジニアリング実装に浪費しています。

UniRL フレームワークアーキテクチャ

UniRLはマルチモーダルRLのクローズドループを統一:rollout -> reward -> advantage -> train -> weight-sync。

対応するモデル

UniRLは、業界で最も広範なマルチモーダル生成モデル対応を提供します:

領域対応モデル
画像生成SD3/3.5、Qwen-Image、Z-Image、FLUX.2-Klein
動画生成HunyuanVideo 1.0&1.5、WANシリーズ
大規模言語モデルQwen3シリーズ
マルチモーダル理解Qwen-VLシリーズ
ネイティブ統一モデルHunyuanImage 3.0、Bagel
組み合わせ型モデルLLM/VLM + Diffusion の Prompt-Enhancer

内蔵アルゴリズムと報酬システム

アルゴリズム側

  • Policy-gradientファミリー:FlowGRPO、DanceGRPO、MixGRPO、LLM/VLM GRPO
  • Forward-processファミリー:DiffusionNFT(完全なSDE rolloutが不要な効率的訓練)
  • Tencent Hunyuan自社開発:
    • Flow-DPPO:PPO ratio clippingを逐步KLダイバージェンスの近傍制約で置き換え、より安定したflow/diffusionモデルのRL訓練を実現
    • DRPO:ハードクリップ/マスクを、advantage重み付きの滑らかなポリシーシフト正則項で置き換え、信頼領域の境界を越えた場合でも連続的な勾配修正を提供

報酬側

UniRLは複数クラスの常用rewardコンポーネントを統合しています:

  • ルール/類似度:CLIPScore、GOT-OCR-2.0
  • 選好/美学:PickScore、HPSv2/HPSv3、ImageReward
  • VLM-as-judge:UnifiedReward、GenEval2、WISE
  • 動画評価:VideoPickScore、VideoAlign

核心設計

UniRLは、Ray worker group、Hydra flat recipe、コンポーザブルな訓練バックエンド、プラグイン可能なrollout engineを核心の骨格とします。軌跡(track)表現で異なる段階の生成軌跡を表します:AR段階はTextSegment、画像生成段階はLatentSegmentで、異なるtrack同士はparent-child関係で接続されます。

これにより、BagelやHunyuanImage 3.0のような統合マルチモーダルモデル(先にARテキスト思考、その後にDiT画像生成)のチェーンフローが自然に表現できます。

使い方

フレームワークには充実したexamplesが用意されており、実験の迅速な開始とアルゴリズムの再現が容易です。現在も活発な反復開発段階にあり、今後はrollout engine対応の拡張と、大規模訓練性能の最適化を継続します。

関連記事

TerminalWorld:初の実CLIワークフローAgentベンチマーク
AIチュートリアル

TerminalWorld:初の実CLIワークフローAgentベンチマーク

8万件の人間のターミナル録画から鍛え上げられた1530タスクの評価セット。18類のワークフロー、1280個のコマンドツールをカバーし、Agentが実ターミナルシーンで「ランキング高得点、実投入で失敗」という持病を抱える問題に効く特効薬です。

Toolin 編集部
若愚攬月01:世界初のAI防爆ロボット、実車に自分で給油する
AI製品

若愚攬月01:世界初のAI防爆ロボット、実車に自分で給油する

若愚九天ロボットブレインに駆動される防爆ロボット攬月01は、ガソリンスタンドで24時間、キャップ開け・ノズル取り・注油・ノズル戻しの全工程を自律的にこなし、身体知能を高リスクシーンへ落とし込みました。

Toolin 編集部
TRIAD:AIエージェントに拒否だけでなく危険な計画の修復までできるようにする
AI製品

TRIAD:AIエージェントに拒否だけでなく危険な計画の修復までできるようにする

オープンソースのAgent安全フレームワークTRIADは、2値分類のガードレールを3路判断(継続/更新/拒否)に置き換え、プロンプトインジェクション攻撃下でもユーザーの本来タスクを守ります。

Toolin 編集部
Volcano EngineのAgent Infra全面アップグレード:1+N+X体系、AgentKitとArkClaw企業版
AI製品

Volcano EngineのAgent Infra全面アップグレード:1+N+X体系、AgentKitとArkClaw企業版

Seedance 2.0の瞬間から企業級Agentインフラまで。Volcano Engineは1+N+X体系、AgentKit、ArkClaw企業版によって、Agentを個人ツールから組織のワークフローへ本当に移します。

Toolin 編集部
Baidu DuMate 実践ガイド:中国版 Codex で口頭指示だけでオフィス作業を進める
AIチュートリアル

Baidu DuMate 実践ガイド:中国版 Codex で口頭指示だけでオフィス作業を進める

インストールから自動化まで、Baidu DuMate の「リクエスト→承認→実行→成果物」の一連の流れを完全分解。アプリ横断作業、定時タスク、クレジット明細を1本でまとめて解説

Toolin 編集部
DeNovoSWE:初のロングホライズン Doc2Repo 訓練セット、Code Agent にリポジトリ構築を学ばせる
AI製品

DeNovoSWE:初のロングホライズン Doc2Repo 訓練セット、Code Agent にリポジトリ構築を学ばせる

中国人民大学が4818件の実タスクインスタンスを含むオープンソース訓練セットを発表。Agentのリポジトリレベルコード生成専用で、Qwen3-30Bの通過率を5.8%から47.2%へ引き上げ

Toolin 編集部