RhymeFlow:オープンソース動画生成を1.8倍高速化

·Toolin 編集部

清華大学が動画生成高速化フレームワーク「RhymeFlow」をオープンソースで公開。再学習なしでWan 2.1やCogVideoXなどのDiTモデルの推論を1.5x-1.8x高速化でき、品質はほぼ無損失。62.5%のユーザーが差を区別できませんでした。

RhymeFlow:オープンソース動画生成を1.8倍高速化

清華大学とGigaAIは共同でRhymeFlowをオープンソース化しました。完全に学習不要の動画生成高速化フレームワークです。モデルの再学習は必要なく、推論段階で「フレーム間非同期スケジューリング」を直接適用することで、Wan 2.1やCogVideoXなどのDiT動画モデルの推論速度を1.5倍から1.8倍へ向上させます。

82人の二重盲検ユーザースタディでは、62.5%のユーザーがRhymeFlowの出力を元のモデルと区別できませんでした。

どの問題を解決するのか

現在の主流DiT動画モデル(Wan 2.1、CogVideoX、Sora)には共通の痛点があります。81フレームの720p動画を1本生成するのに、A800 GPU 1枚で17分近くかかるのです。

既存の高速化手法(スパースアテンション、KVキャッシュ、量子化)が最適化するのは単一ステップ内の計算量です。しかし、より根源的な問題には誰も手をつけていませんでした——すべてのフレームが一律に扱われること。隣接フレームの内容がほぼ完全に同じでも、完全な50ステップのノイズ除去プロセスを最後まで歩む必要があります。

RhymeFlowの核心となる洞察は、動画のセマンティクスと運動は連続であり、キーフレームが全体構造を決め、非キーフレームの軌跡は高度に予測可能だというものです。それならば、なぜ異なるフレームにそれぞれ独自の道を歩かせないのでしょうか?

Image

3つのコアモジュール

1. コンテンツ感知のキーフレーム選択

単純な均一サンプリングではなく、潜在空間のセマンティック類似度によって、シーン切り替えや物体の急激な運動変化を含むキーフレームを自動識別します。これらのフレームには完全な計算リソースが割り当てられ、動画の構造完全性とセマンティック正確性が確保されます。

2. 段階的非同期ノイズ除去スケジューリング

キーフレームは毎ステップ更新され、非キーフレームはノイズ段階に応じた差別化されたスキップで進行します。

  • ウォームアップ段階(最初の15ステップ):すべてのフレームが同期してノイズ除去を行い、全体構図の基礎を固める
  • 高ノイズ段階(構造に敏感):非キーフレームは2ステップに1回更新
  • 低ノイズ段階(ディテール最適化):非キーフレームは3ステップに1回更新
  • 同期ポイント:定期的にすべてのフレームを合流させ、非キーフレームの軌跡を較正して、誤差の蓄積を防止

3. 潜在変数軌跡投影

非キーフレームがステップをスキップすると、中間状態の欠如が3Dアテンションの時間的一貫性を損ないます。RhymeFlowは計算量が無視できる線形投影モジュールを使い、前後の2つの既知状態から中間時刻の潜在変数を高精度に予測します——非キーフレームに滑らかな運動軌跡を描くのに相当します。

Image

実験結果

主流オープンソースモデルでのテスト結果:

SOTA手法との比較:

  • Wan 2.1では:RhymeFlowのPSNRはSAPより1.84高く、SSIMは0.053高く、速度は同等
  • CogVideoXでは:1.78倍の高速化率で、98.6%の主体一致性を維持
  • SAPと重ねた場合:高速化率はさらに1.93倍まで向上し、品質もSAP単独使用を上回る

Image

82人二重盲検ユーザースタディ:

  • 53.7%のユーザーがRhymeFlowの時間的整合性はSVGより優れていると評価
  • 74.4%のユーザーがSAPよりRhymeFlowを好む
  • 元のモデルとの比較では、62.5%のユーザーが差を区別できず、統計的に有意な違いはなし

適したシーン

RhymeFlowは以下のようなシーンに適しています。

  • Wan 2.1、CogVideoXなどのオープンソースDiT動画モデルによるバッチ動画生成
  • 動画生成の推論コストを削減したい(GPU時間が約半分に短縮)
  • 動画品質への要求はあるが、極めて微小な品質低下は許容できる

入手方法

フレームワークは完全なオープンソースで、モデルの再学習は不要。既存のDiT推論パイプラインに直接統合できます。