Hallo-Live:リアルタイム・テキスト駆動の音声付き動画デジタルヒューマン

·Toolin 編集部

オープンソースのリアルタイムデジタルヒューマン生成ソリューション。テキスト入力だけで発話動画と音声を同期生成し、20.38 FPSのスループットと0.94秒のエンドツーエンド遅延を実現します。

Hallo-Live:リアルタイム・テキスト駆動の音声付き動画デジタルヒューマン

テキスト駆動の音声付き動画デジタルヒューマンは、「生成できる」から「リアルタイムに対話できる」へと進みつつあります。上海創智学院、復旦大学などの機関による Hallo-Live プロジェクトは、2枚の NVIDIA H200 GPU 上で 20.38 FPS のスループットと 0.94 秒のエンドツーエンド遅延を実現しながら、教師モデルに迫る視覚品質と音声・映像の同期効果を保っています。

論文アドレス:arxiv.org/abs/2604.23632 コードアドレス:github.com/fudan-generative-vision/Hallo-Live

Hallo-Live とは何か

従来の音声駆動デジタルヒューマンはリップシンクだけで済みましたが、テキスト駆動の方式は2つのことを同時にこなす必要があります。まずテキストの中の人物、シーン、語調を「理解」し、それから対応する発話動画と音声を同期して生成します。口の形、発音、表情、さらには上半身の動きまで、すべて同じタイムラインに厳密に揃えなければなりません。

教師モデル Ovi と比べた Hallo-Live の主要指標:

指標Hallo-Live向上
スループット20.38 FPS16.0倍に向上
エンドツーエンド遅延0.94 秒99.3%低下

アニメ調、実写人物、複数人シーンに対応しており、GitHub でオープンソース化されています。

コア技術

非同期双ストリーム拡散(Asynchronous Dual-Stream Diffusion)

Hallo-Live の訓練は2段階に分かれます:

  • Stage 1 -- Dual-Stream ODE Init:モデルに異なる noise level の音声・映像 blocks を同時に入力し、単一モーダルおよびクロスモーダルの Block-Causal Mask に基づいて双ストリーム DiT を訓練
  • Stage 2 -- Self-Rollout + Dual-Stream DMD:学生モデルが音声・映像の KV Cache に基づいて完全な音声・映像を自己回帰生成し、さらに音声・映像の同期に関連する reward を導入して few-step モデルへ蒸留

全体アーキテクチャ

Causal Fusion Block

これは双ストリーム DiT の中核ユニットです。映像ストリームと音声ストリームはまずそれぞれ単一モーダルの Block-Causal Self-Attention を行い、次にテキスト条件を注入し、その後クロスモーダルな Block-Causal Cross-Attention で情報を交換して、ストリーミング生成のもとで音声と映像の融合を完了します。

Causal Fusion Blockの構造

Future-Expanding Attention

実際の発話では、唇の動きはしばしば音声に先んじて現れます(協同調音現象)。厳密に因果なブロック単位のアテンションは「短時間の未来」の音声情報を見られず、口の形が不自然になります。

Hallo-Live は映像から音声へのクロスモーダルアテンションを「非対称」にします:映像は現在のブロックに注視しつつ、音声のキー・値の範囲だけが前に少し拡張された look-ahead ウィンドウを持ち、いわば映像ストリームに短時間の「先読み領域」を与えます。

Future-Expanding Attentionの仕組み

この未来の音声ブロックは最終出力ではなく一時的な経過ブロックで、音声品質を損ないません。

人間の嗜好に導かれた蒸留

少ステップ蒸留は高速化できますが、「平均化」という劣化を招きやすいものです -- 映像の質感がぼけ、音声がより機械的になり、音と映像の位置合わせがずれます。Hallo-Live は音声、映像、音声・映像の同期に関連する reward を導入して双ストリーム DMD 損失を重み付けし、高速化しつつ生成品質を維持します。

応用シーン

  • バーチャル配信者 / デジタルヒューマンのライブ配信:リアルタイムのテキスト駆動で、ライブ配信のインタラクションに適する
  • カスタマーサポートのデジタルヒューマン:テキスト入力から音声と動画の返信をリアルタイム生成
  • コンテンツ制作:音声付きデジタルヒューマン動画をバッチ生成
  • 教育/研修:デジタルヒューマンの講師を生成して講義を行う

技術要件

  • ハードウェア:2枚の NVIDIA H200 GPU(論文の実験環境)
  • 入力:テキスト + 参照人物画像
  • 出力:同期した発話動画 + 音声
  • 遅延:0.94秒エンドツーエンド

プロジェクトは GitHub でオープンソース化されており、デジタルヒューマン対話やリアルタイムストリーミング生成に取り組む研究者・開発者に適しています。

参考リンク: