Wan-Streamer v0.2:エンドツーエンド 550ms レイテンシの全モーダル・リアルタイム対話モデル

·Toolin 編集部

Alibaba Tongyi の Wan-Streamer v0.2 は、聞く・見る・話す・演じるを 1 つの Transformer に統合し、約 550ms のエンドツーエンドレイテンシで全二重の音声動画インタラクションを実現します。本記事ではアーキテクチャ、主要指標、適用シナリオを解説します。

Wan-Streamer v0.2:エンドツーエンド 550ms レイテンシの全モーダル・リアルタイム対話モデル

7 月 17 日、Alibaba の Tongyi(通義)ラボが Wan-Streamer v0.2 を公開しました。リアルタイムの全二重音声動画インタラクションに向けた、エンドツーエンドの全モーダル(omni)モデルです。平たく言えば、本当に「つながった」AI テレビ電話です。こちらが一言話すと、相手は聞きながら画面と音声での応答を生成していく。エンドツーエンドのレイテンシは約 550ms です。このブレークスルーのポイントは「また少し速くなった」ことではなく、聞く(ASR)、見る(視覚理解)、話す(TTS)、演じる(動画生成)という 4 つの機能を初めて 1 つの Transformer に統合し、従来方式で組み合わせていた複数の独立モジュールを切り捨てたことにあります。本記事では、これが何者で、主要指標はどうで、アーキテクチャ上の違いと適用シナリオを解説します。リアルタイムデジタルヒューマン、AI カスタマーサポート、音声コンパニオン系プロダクトを手がける開発者に適した内容です。

Wan-Streamer とは

Wan-Streamer は Alibaba Tongyi が送り出すエンドツーエンドの全モーダル理解・生成モデルで、リアルタイムかつ全二重の音声動画インタラクションのために設計されています。「全二重」とは、電話のように聞くと話すを同時に行えるという意味です。従来の対話のような「相手が言い終わってから返す」半二重方式とは違います。

v0.2 の主要指標:

指標数値説明
エンドツーエンドのインタラクションレイテンシ約 550ms約 350ms のネットワーク伝送を含む
出力解像度640×368v0.2 は v0.1 から解像度を引き上げた
フレームレート25 FPS動画出力のフレームレート
レイテンシの変化v0.1 と同等解像度は上がったが、レイテンシは変わらず

550ms という数字は分解して見る必要があります。このうち約 350ms はネットワーク伝送で、純粋なモデル側のレイテンシは 200ms のオーダーです。つまり弱いネットワーク環境では、体験はモデルではなく主にネットワークに引っ張られることになります。

コア機能

1. 単一 Transformer で 4 モーダルを統合

これが Wan-Streamer 最大のアーキテクチャ上の違いです。従来のリアルタイムデジタルヒューマン方式は「継ぎ接ぎ」で作られています:

[従来方式]
マイク → ASR(音声からテキスト) → LLM → TTS(テキストから音声) → 動画生成モデル → 画面
   どの段階も独立したモデルで、レイテンシと誤差が段階的に積み上がる

[Wan-Streamer]
マイク → [単一のストリーミング因果 Transformer] → 画面
   聞く/見る/話す/演じるを 1 つのモデル内で完結

中間段階を切り捨てた直接的な利点は、レイテンシが下がること、モジュール間の情報ロスが減ること、そして唇の動きと感情の同期がより自然になることです。

2. ネイティブなストリーミング因果 Transformer

Wan-Streamer が採用するのは、ネイティブなストリーミング因果 Transformer アーキテクチャです。「因果(causal)」とは、モデルが過去だけを見て未来を見ないことを指します。これはリアルタイムインタラクションが満たすべき必須条件で、ユーザーが文を言い終わるのを待ってから反応する、というわけにはいかないからです。これに分散推論トポロジーを組み合わせることで、単一フレームの生成レイテンシを制御可能にしています。

3. 640×368 @ 25FPS の動画出力

v0.2 は v0.1 に比べて解像度が大きく引き上がり、フレームレートは 25FPS で安定、レイテンシは変わりません。この解像度は次のような用途には十分です:

  • デスクトップ/モバイルのビデオ通話ウィンドウ
  • デジタルヒューマンによるカスタマーサポートのウィンドウ
  • 組み込み型のライブ配信シーン

ただし、1080P の高精細ライブ配信の水準にはまだ届きません。

実際の使い勝手

長所

  • 真の全二重:いつでも割り込める、補足できる。AI が言い終わるのを待つ必要がありません。「半二重の音声アシスタント」との最大の体験差はここです。
  • 低レイテンシ:550ms のオーダーは日常のビデオ通話として成立する水準で、ユーザーは「反応が遅い」をほとんど感じません。
  • アーキテクチャがシンプル:1 つのモデルでパイプライン一式を置き換えられ、デプロイと運用の複雑さが下がります。

検討が必要な点

  • 解像度の天井:640×368 は、画質への要求が高いライブ配信や映像制作のシーンには向きません。
  • ネットワークへの敏感性:350ms のネットワーク遅延が 60% 超を占めます。デプロイ時はノードをユーザーの近くに置く必要があります。
  • 計算リソースのハードル:リアルタイム音声動画の生成は、テキストのみの対話よりはるかに多くの計算リソースを消費します。1 同時接続あたりのコストを重点的に見積もる必要があります。

活用シナリオ

  • AI ビデオカスタマーサポート:EC、金融、公共・企業窓口のリアルタイム対面相談。既存の音声ロボットを置き換える
  • デジタルヒューマン・コンパニオン / 音声アシスタント:継続的な対話と感情の同期が要る、コンシューマー向けのシーン
  • リアルタイム翻訳 / 同時通訳:全二重 + 低レイテンシという特性は、動画付きリアルタイム翻訳に向く
  • 教育コンパニオン:1 対 1 のリアルタイム解説と質疑応答。学生の反応を見る必要があるシーン

利用前に注意すべきこと

  • 計算コストが最大のハードル:25FPS のリアルタイム動画生成は、テキストモデルより GPU の占有率がはるかに高いです。選定の前に「1 同時接続あたりのコスト」をきちんと算出し、そのうえでエンドツーエンド方式を採るか決めてください。
  • 550ms には条件がある:この数字は、ユーザーの近くへのデプロイ + 良好なネットワーク条件が前提です。自分のターゲットとなるネットワーク環境で、P95 レイテンシを自測することをおすすめします。公式の標記値だけを見てはいけません。
  • エコシステムはまだ初期:v0.2 は依然として高速なイテレーション中のバージョンで、API やパラメータが変更される可能性があります。本番環境に組み込む前に、安定性に関するコミットを確認してください。

参考ソース

  • Tongyi ラボ公式発表(2026-07-17)
  • Wan-Streamer v0.2 技術レポートおよびオープンソース情報