Gamma-World:オープンソースのマルチエージェント世界モデル

·Toolin 編集部

NVIDIA が清華大学と共同でマルチエージェント世界モデルをオープンソース化。2人での訓練から4人へ直接汎化し、ゼロショットでの多人数シーンのリアルタイム推演をサポート

Gamma-World:オープンソースのマルチエージェント世界モデル

既存の動画世界モデル(Sora、Cosmos、Genie)はいずれも、世界に参加者が1人しかいないことを前提にしています。しかし実際のシーンでは、多人数ゲーム、工場の生産ライン、ロボットの協作業業のいずれも、複数のエージェントが同じ進化する世界を共有する必要があります。NVIDIA が清華大学、トロント大学と共同で発表した Gamma-World は、位置エンコーディングと注意機構を低いレイヤーから再設計し、マルチエージェント世界モデルを本当にスケーラブルかつ汎化可能にしました。

核心的な問題:なぜマルチエージェントはこれほど難しいのか

単一エージェントの世界モデルは時間的一貫性だけを保証すればよいのですが、マルチエージェントの設定では、モデルが同時に三重の一貫性を維持することが求められます。

  • 時間的一貫性:画面が時系列でつながっている
  • 視点間の一貫性:プレイヤー A がプレイヤー B の視野に映る姿が A の軌跡と一致する
  • 相互作用の一貫性:共有環境に対する複数エージェントの操作が、すべての視点で一貫した状態変化を生む

従来最強のソリューションである Solaris には2つの構造的欠陥がありました。アイデンティティエンコーディングが対称性を壊すこと(1番と2番のプレイヤーが異なるキャラクターとして学習されてしまう)、そして全結合注意力の計算量がプレイヤー数の二乗で増えることです。

3つの核心設計

1. 正単体回転エンコーディング(Simplex Rotary Agent Encoding)

Gamma-World は、標準的な動画 RoPE の3軸(時間、高さ、幅)のほかに第4の軸を追加しました。プレイヤー軸です。鍵となるのはプレイヤー軸上のエンコーディング方式です。

すべてのプレイヤーを正単体(regular simplex)の頂点上に配置します。

  • 2人のプレイヤー = 線分の両端
  • 3人のプレイヤー = 正三角形の3つの頂点
  • 4人のプレイヤー = 正四面体の4つの頂点

正単体エンコーディングの模式図

どの2人のプレイヤーを取っても、回転角空間における距離は完全に同じで、誰も特別扱いされません。このエンコーディングは学習可能なパラメータを一切必要とせず、推論時にもっと多くのプレイヤーをサポートしたくなったら頂点プールからいくつか頂点を追加で取るだけでよく、アーキテクチャの変更も再訓練も不要です。

2. スパースハブ注意力(Sparse Hub Attention)

全結合注意力はすべてのトークンをペアで相互作用させ、8人のプレイヤーでは計算量が 7.6T に達します。Gamma-World は学習可能な hub token の集合を共有通信のハブとして導入しました。

  • 各エージェントは自身の履歴と hub token とのみ相互作用する
  • hub token がすべてのエージェントの情報を集約してからブロードキャストする
  • 情報経路は2ホップになる:エージェント -> hub -> エージェント

Sparse Hub Attention vs Dense Attention

計算コストは二乗の複雑度から線形の複雑度へ圧縮されます。8人のプレイヤーでは、Gamma-World の演算力消費は全結合方案のわずか 8分の1 で、レイテンシは 17.6ms から 4.5ms に下がります。

3. 三段階蒸留

双方向の教師(品質は最高だがストリーミング不可)から因果的な生徒(ストリーミング対応だが品質は低下)へ、条件付き Self-Forcing 蒸留によって多段階サンプリングを4ステップサンプリングに圧縮し、最終的に 24 FPS のストリーミング推演を実現しました。

主要な結果

ゼロショットの4人汎化

モデルは2人用データのみで訓練されていますが、推論時にいきなり4系統の同期視点を生成でき、アーキテクチャのパラメータを一切変更する必要がありません。

4人 Minecraft のゼロショット汎化

これは単体エンコーディングの直接的な検証です。任意のプレイヤー数への汎化には、その数の訓練データを見る必要がないのです。

ゲームから実ロボットへ

同じフレームワークを Minecraft から実際の双腕ロボットの協調タスクへ直接移行しました。左右2本のマニピュレータがそれぞれ独立したエージェントとして扱われ、生成された未来フレームは双腕の協調運動と空間配置を保っており、追加の適応は不要でした。

Solaris を全面的に上回る

多人数 Minecraft の5種類のシーンにおいて、Gamma-World の FVD(動画生成品質指標)は平均で40%以上低下しました。消融実験では、単体エンコーディングが最大の単独ゲインをもたらすことが示されています。

入手方法

適したシーン

  • 多人数ゲーム環境のリアルタイムシミュレーションとデータ生成
  • 複数ロボット協調タスクのシミュレーション訓練
  • 身体性エージェントのマルチエージェント相互作用研究
  • Physical AI 分野のニューラルシミュレーション基盤

Gamma-World の核心的な方法論は、問題構造への理解をアーキテクチャに直接エンコードすることであり、モデルがデータから自力で発見することを期待するのではありません。マルチエージェントシミュレーション、ロボット協調、ゲーム AI 関連の仕事をしているなら、このフレームワークは深く注目する価値があります。