ShotStream:マルチショット長編動画をリアルタイムに演出するオープンソースフレームワーク(ECCV 2026)
香港中文大学 MMLab と Kuaishou Kling が共同オープンソース化した ShotStream は、初のリアルタイムストリーミング型マルチショット長編動画生成フレームワークで、生成速度は約25倍に向上し、生成しながらのストーリー調整に対応します。


ShotStream:マルチショット長編動画をリアルタイムに演出するオープンソースフレームワーク(ECCV 2026)
香港中文大学 MMLab と Kuaishou Kling が共同オープンソース化した ShotStream は、初のリアルタイムストリーミング型マルチショット長編動画生成フレームワークで、生成速度は約25倍に向上し、生成しながらのストーリー調整に対応します。
AI に一貫性のあるマルチショットの長編動画を生成させる従来のやり方は、すべてのカットのプロンプトを一括でモデルに投げ込み、出来上がりまで約30分待ち、その間は一切調整できない、というものでした。ShotStream はこの膠着状態を打破します——初のリアルタイムストリーミング型マルチショット長編動画生成フレームワークであり、香港中文大学 MMLab と Kuaishou Kling(可霊)チームの共同発表で、ECCV 2026 に採択され、モデル・学習コード・評価コードがすべてオープンソースとして公開されています。生成速度は従来手法の約25倍です。
ShotStream とは
ShotStream が解決する核心的問題は、マルチショット長編動画生成における「高遅延+ゼロインタラクション」のジレンマです。
従来手法(双方向拡散アーキテクチャベース)のワークフロー:
- すべてのカットのプロンプトを一度に書き上げる必要がある
- モデルが全カットをまとめて処理し、カット間のつながりを確保する
- 完全な動画が出るまで約30分待つ
- 途中でストーリーを変えたくなったら? もう一度最初からやり直し
ShotStream の発想はまったく別で、マルチショット合成を履歴ベースの自己回帰プロセスとして定式化し、各カットを、すでに生成済みの前のカットに基づいてストリーミング生成します。これにより:
- 生成しながらストーリーを調整できる
- リアルタイムの対話型制作ができる
- 生成速度が約25倍に向上する

自己回帰型のストリーミング生成=新しいカットが毎回「前のカットを見ながら」生成される。つながりを保証しつつ、いつでも新しいストーリー指示を割り込ませられます。
コア機能
リアルタイムのストリーミング生成
もう30分待つ必要はありません。ShotStream はライブ配信のようにカット単位で出力します:
- 1つ目のカットが完成した瞬間、すぐに見られる
- 1つ目のカットを見たあと、2つ目のカットのプロンプトを修正できる
- 2つ目のカットは1つ目のカットとあなたの新しい指示に基づいて生成される
クリエイターにとってこれは、すべてのプロンプトを書き上げて一発の完成を祈るのではなく、AI 動画を本物の意味で「演出」できるということです。
マルチショット一貫性
マルチショット長編動画の最大の技術的難所はカット間の一貫性です——同じキャラクターがカット1では赤い服を着ているのに、カット2で青い服になってはいけない。同じシーンの光の方向も一致している必要があります。
ShotStream は自己回帰的な履歴モデリングでこれを解決します。新しいカットはすべて前のカットを条件とするため、キャラクターの外見、シーン設定、カメラワークが自然に引き継がれます。
25倍の速度向上
一括生成型の従来マルチショット動画モデルと比べて、ShotStream の速度は約25倍です。主な理由:
- 自己回帰ストリーミングでは、全カットを一括処理する必要がない
- 単一カットの生成を十分に並列最適化できる
- 履歴情報はコンパクトな表現に圧縮され、再計算が不要

技術の仕組み(概要)
ShotStream の鍵となるイノベーション:
- ストリーミング自己回帰モデリング:マルチショット合成を「一括の双方向」から「履歴ベースの自己回帰」へ変更
- 履歴圧縮:生成済みカットの情報をコンパクトなコンテキストに圧縮し、次のカットの生成条件とする
- リアルタイム指示の注入:各カットの生成前に新しいユーザー指示を受け付け、「生成しながらの調整」を実現
このアーキテクチャはインタラクティブなストーリーテリングと相性が抜群で、視聴者の選択ひとつが次のカットに即座に影響します。
使い方
準備
- オープンソースリポジトリ:
ShotStreamで検索するか、香港中文大学 MMLab / Kuaishou Kling の公式 GitHub を確認 - 論文:ECCV 2026 採択。論文タイトルで検索すれば見つかります
- ハードウェア:GPU 推論を推奨(具体的なスペックはリポジトリの README を正としてください)
典型的な流れ
ステップ1:初期カットを定義
最初のカットの記述を入力します。たとえば:
「カット1:俯瞰ショット。夜の都市の屋上。主人公がコート姿で縁に立ち、風が裾をなびかせている。」
ShotStream が1つ目のカットを生成して表示します。
ステップ2:カットをストリーミングで追加
1つ目のカットを見たあと、次の指示を入力します:
「カット2:正面のクローズアップに切り替え。主人公が振り返ってカメラを見つめ、毅然とした表情。」
ShotStream は1つ目のカットに基づいて2つ目のカットを生成し、人物の外見と夜の光を維持します。
ステップ3:ストーリーをリアルタイム調整
2つ目のカットに満足しない場合、ストーリーの方向を変えたい場合:
「カット2を変更:主人公が空を見上げ、ドローンが1機飛び越えていく。」
モデルは1つ目のカットと新しい指示に基づいて、2つ目のカットを再生成します。
ステップ4:長編動画を書き出し
全カットの生成が完了すると、ShotStream が自動でつなぎ合わせて、一貫したマルチショットの長編動画として mp4 形式で書き出します。
ヒント:ストリーミング生成では、各カットが完成したらまず素早くプレビューし、不満があればすぐ直すほうが、全部完成させてから直すより時間の節約になります。
適したシーン
| シーン | 推奨度 | 理由 |
|---|---|---|
| インタラクティブな物語/インタラクティブ動画 | 強く推奨 | リアルタイム調整が核心のセールスポイント |
| ショート動画/広告のマルチカット脚本 | 強く推奨 | 高速+カット間のつながり |
| 映像制作の前段階での絵コンテプレビュー | 推奨 | 監督がカットをリアルタイムに調整できる |
| 単一カットのショート動画 | 普通 | 単一カットでは優位性が薄い |
| ライブ配信でのリアルタイム生成 | 慎重に | 25倍の高速化後も遅延はあり、さらなる最適化が必要 |
同種手法との比較
| 手法 | リアルタイム対話 | マルチショット一貫性 | オープンソース | 向いている用途 |
|---|---|---|---|---|
| ShotStream | あり | 強い(自己回帰) | あり | インタラクティブ/ストリーミング制作 |
| 従来のマルチショットモデル | なし | 強い(双方向) | 一部 | 一括での完成動画制作 |
| 単一カット生成(Kling、Sora など) | N/A | 手動でつなぐ必要 | なし | 単一カットのシーン |
よくある質問
- リアルタイム生成の遅延はどのくらいか:単一カットの生成遅延はリポジトリの実測値を正としてください。全体としては従来手法より約25倍速いです。
- 商用プロジェクトに使えるか:モデルはオープンソース済みです。商用の条件はリポジトリの LICENSE を正としてください。
- どのくらい長い動画まで対応するか:理論上、自己回帰は無限に継続できますが、実際には VRAM と一貫性の劣化が限界になります。1回あたり10カット以内を推奨します。
- キャラクターの一貫性が時々揺らぐ:長編の後半ではキャラクターがわずかに変化することがあります。5カットごとに「キャラクターアンカー」のプロンプトを挿入するのがおすすめです。
関連リンク
- 搜狐の記事:https://m.sohu.com/a/1049298810_129720
- ECCV 2026 論文(ShotStream で検索)
- 香港中文大学 MMLab / Kuaishou Kling の GitHub