UniWorld-View:1枚の画像/動画から任意のカメラ軌跡を生成、WorldScore首位の完全オープンソース

·Toolin 編集部

北京大学 + 兔展智能 + 鵬城実験室がオープンソース化した UniWorld-View は、1枚の画像/動画から任意のカメラ軌跡の新視点動画を生成し、李飛飛チームの WorldScore ランキングで首位。コードと重みは Apache-2.0 で完全オープンソース、ワンクリックダウンロードにも対応します。

UniWorld-View:1枚の画像/動画から任意のカメラ軌跡を生成、WorldScore首位の完全オープンソース

3D 再構築、映像 VFX、空間コンピューティング、ゲームのプリビズをやっているなら、「1枚の画像から任意視点の動画を生成する」という課題にはさんざん苦しめられてきたはずです。UniWorld-View は、北京大学(袁粒研究室)+ 兔展智能 + 鵬城実験室が共同でオープンソース化した世界モデルで、手撮りのモノキュラー動画1本、ひいては画像1枚を入力に、任意のカメラ軌跡での新視点動画(Novel View Synthesis、NVS)+ 4D 再構築を出力します。李飛飛チームが管理する WorldScore ランキングで1位を取り、コードと重みは Apache-2.0 で完全オープンソース、国産の昇騰(Ascend)算力への適合も謳っています。この記事では、ローカルで動かすところまでを通します。

UniWorld-View とは

ひと言で位置づければ:1枚の画像/動画 → 任意のカメラ軌跡の新視点動画ジェネレーター。

解決するのは NVS(Novel View Synthesis)の核心的な難題——自分が見られるのは1つの視点の画面だけで、モデルには、他の任意の角度から見た、ジオメトリも外見も合理的かつ一致した動画を頭の中で補完する役目が課される、というものです。「画像から動画」モデルとは違い、UniWorld-View は幾何一貫性を重視し、4D 再構築、空間アセットの生産、仮想撮影のプリビズに直接使えます。

公式の言葉をそのまま引けば:"ranked 1st on the WorldScore Leaderboard (by Stanford Prof. Fei-Fei Li's Team)"——すなわち、李飛飛チームが管理する世界モデル評価ランキングの1位です。

技術の見どころ

生成品質を決めている2つのキー設計があります:

  • 遮蔽認識点群レンダリング(Occlusion-aware Point Cloud Rendering):入力の画像/動画をまず遮蔽情報つきの点群へ逆算し、そこから新視点をレンダリングすることで、「空中から補完する」ことによる幾何の貫通を防ぎます。
  • 双ストリーム条件注入(Dual-stream Conditioning):ジオメトリストリーム(geometry stream)+ 外観ストリーム(appearance stream) の2系統に分けます。ジオメトリストリームは Ref-DiT モジュールで構造を制御し、外観ストリームは色とテクスチャを担い、2系統の条件を生成のバックボーンへ同時に流し込みます。「形は合っているのにテクスチャが飛ぶ」、あるいはその逆を避けるためです。

この幾何 / 外観の分離という発想こそ、WorldScore 1位を取れた構造的な理由です。

始める前の準備

  • GPU:公式の推奨は VRAM 60GB 以上で、快適に推論できます(A100 80G / H100 が理想構成)。それより小さい VRAM のカードでも試せますが、推奨ルートではありません。
  • Python 環境:リポジトリの README に従って構成します(PyTorch + 対応する CUDA)。
  • ストレージ:重みの体積は大きめなので、ディスクの空き容量を十分確保してください。
  • 国産の昇騰(Ascend)算力:リポジトリは適合を宣言しており、関連の説明は README を参照してください。

プロジェクトリポジトリ:https://github.com/PKU-YuanGroup/UniWorld-View (Apache-2.0) モデル重み:https://huggingface.co/Drexubery/UniView

ステップ1:リポジトリをクローンする

git clone https://github.com/PKU-YuanGroup/UniWorld-View.git
cd UniWorld-View

ステップ2:重みをワンクリックでダウンロードする

リポジトリ同梱のスクリプトで、HuggingFace から checkpoint をすべて引き出します:

bash checkpoints/download_hf.sh

ダウンロードが終わると重みは checkpoints/ ディレクトリに置かれ、実行時に自動でロードされます。

ステップ3:推論を回す

コマンドライン推論(バッチ処理向き):

bash run_infer.sh

Gradio の可視化 UI(インタラクティブな調整向き):

bash run_app.sh

起動したら、画像1枚かモノキュラー動画をアップロードし、欲しいカメラ軌跡(プッシュ、プル、周回飛行、横移動など)を指定します。生成の完了を待てば、新視点動画が見られます。

💡 ヒント: VRAM が厳しいときは、まず Gradio UI で生成解像度とフレーム数を下げて反復検証し、カメラ軌跡が妥当だと確認してから高品質のパラメータで最終結果を回しましょう。テクスチャの細部より、幾何の正しさを先に検証する価値があります。

検証結果

生成結果は1本の動画で、指定したカメラ軌跡に沿って、入力シーンのまったく新しい視点を見せてくれます。成功を判断する3つの基準:

  1. 幾何が一貫している:シーン内の物体の相対位置や形状に、貫通やドリフトがない。
  2. 外観が一貫している:色、テクスチャ、ライティングが入力画像と一致している。
  3. 軌跡が制御どおり:カメラは指定した軌跡に厳密に沿って動き、意図しない急なブレがない。

活用シーン

  • 空間コンピューティング / VR / AR アセット:単一視点の素材 → 多視点で遊べるアセットへ。360°のフル撮影の手間を省きます。
  • 映像 VFX と仮想撮影のプリビズ:実写1本から「もう1台のカメラが見た画面」を素早く生成し、プリ編集や構図の検証に使う。
  • 4D 再構築 / デジタルツイン:NVS 結果を 4D 再構築のパイプラインに繋ぎ、時間変化する幾何を得る。
  • ゲームのプリビズとシーン探索:コンセプトアート1枚から多視点の探索動画を素早く生成し、レベルデザインを検証する。

よくある質問

  • VRAM 不足(OOM): 公式の推奨は 60GB 以上。40GB クラスのカードは解像度とフレーム数を下げるのが得策です。コンシューマー向け GPU(24GB)は現状、このプロジェクトの推奨ターゲットハードウェアではありません。
  • ダウンロードスクリプトが遅い / タイムアウトする: checkpoints/download_hf.sh はデフォルトで HuggingFace から取得します。中国国内のネットワークではミラーかプロキシを推奨。重みの所在:https://huggingface.co/Drexubery/UniView
  • 生成の幾何がドリフトする: 入力画像が平面ばかりでテクスチャが少なすぎないか確認してください。ジオメトリストリームはアライメントに十分なテクスチャ特徴を必要とするため、無地の壁は大敵です。
  • 昇騰算力への適合: リポジトリは昇騰対応を宣言済みです。具体的な依存バージョンとコンパイルオプションは README の該当セクションを参照してください。

おわりに

UniWorld-View のエンジニアリングとしての完成度は、「完全オープンソース」の3文字に見合うものです。HuggingFace 重み + ワンクリックダウンロードスクリプト + コマンドライン / Gradio の二重エントリ + Apache-2.0 ライセンスで、今日から手を付けられます。3D / 映像 / 空間コンピューティング関連の仕事をしているなら、引っ張ってきて一度 run_app.sh を走らせ、自分でカメラ軌跡を指定して結果を見てみてください。論文を読むよりはるかに直感的です。

公式リソース: