Spatial-TTT:2Bパラメータのオープンソース空間知能モデル

·Toolin 編集部

清華大学がオープンソース化したSpatial-TTTがECCV 2026に採択。わずか2Bパラメータで複数の空間知能ベンチマークにおいてGPT-5、Gemini-3-proを上回り、120分のストリーミング動画を処理し、観ながら空間記憶を更新できます。

Spatial-TTT:2Bパラメータのオープンソース空間知能モデル

ロボット、自動運転、ARといった実世界のシーンでは、空間理解は決して「画像を一目見る」だけで解決できるものではありません。カメラは動き、視点は変わり、ターゲットは現れたり隠れたりする——空間情報は長時間の動画ストリームに分散しており、モデルは「見える」だけでなく、**「覚えていられる、つなげられる、さらに継続的に更新できる」**ことが求められます。これはマルチモーダル大モデルが実世界へ踏み出すうえでの重要な敷居の1つです。

清華大学博士課程の劉芳甫(Liu Fangfu)氏が筆頭著者を務める空間知能モデルSpatial-TTTが、コンピュータビジョンのトップカンファレンスECCV 2026に正式採択されました。その答えは一言でいえます。**モデルに動画をただ見せるのではなく、視聴の過程で見ながら、更新しながら、空間記憶を「育てさせる」**のです。

わずか2Bパラメータでありながら、論文でテストされた複数の空間知能専門ベンチマークでGPT-5、Gemini-3-proなどのクローズドモデルを上回り、最長120分のストリーミング動画を処理できます。すでにオープンソース化されています。

Spatial-TTTとは何か

これはマルチモーダルモデル版の「ワーキングメモリ」と理解できます。従来のVLM(視覚言語モデル)は毎回1フレームか固定長の動画断片を見るだけで、空間情報はコンテキストに詰め込むか、そのまま捨てるかです。Spatial-TTTの核心は、推論の過程で外部の空間記憶モジュールへの書き込みと更新を継続的に行うことにより、空間への理解を視聴時間とともに蓄積し、無限に膨らむコンテキストウィンドウに依存させない点にあります。

これは人間の空間理解のしくみにより近い——部屋全体を一度に見終えるのではなく、移動、観察、忘却、修正の中で、安定したspatial memoryを徐々に形づくります。

Spatial-TTTの動作メカニズム

Spatial-TTTがECCV 2026で示した核心のアイデア:ストリーミング動画を観ながら空間記憶を更新し続ける。

コア能力

1. 120分動画のストリーミング処理

すべてのフレームをコンテキストに詰め込むのではなく、test-timeの空間記憶更新メカニズムによって、2時間に及ぶ動画をコンパクトでクエリ可能なspatial stateへ「消化」します。長い動画が乱暴に切り詰められることも、VRAMが爆発することもなくなります。

2. 2Bパラメータでクローズド大モデルに勝つ

SpatialBench、動画空間推論など複数の専門ベンチマークで、2BのSpatial-TTTは、パラメータ量が数十倍あるGPT-5、Gemini-3-proなどのクローズドモデルを上回りました。オープンソースコミュニティが「空間知能」という細分トラックで獲得した珍しいリードです。

3. 静的スナップショットではなく継続更新

本当の売りは単発の推論が強いことではなく、世界が変化したときモデルが追従できることです。同じシーンの中で物体が移動し、隠れ、再び現れても、Spatial-TTTのspatial memoryは動的に修正され、最初に見たスナップショットにとどまりません。

応用シーン

明確なターゲットユーザー:

  • ロボット・身体知能チーム:ロボットのspatial perceptionモジュールとして、長時系列の視覚入力を処理し安定した空間記憶を維持する。汎用VLMを直接使うよりVRAMが節約でき、より安定
  • 自動運転の知覚エンジニア:長時系列の走行動画を処理し、シーンレベルの空間理解とターゲット追跡を行う
  • AR / VRアプリ開発者:変化し続けるカメラ視点のもとで空間アンカリングやセマンティックマッピングを行う
  • 空間知能研究者:強力なベースラインとして再現・改善する。論文とコードは公開済み

冷静に見るべき点として、Spatial-TTTは現時点で専門能力モデルであり、汎用VLMの代替品ではありません——強みは空間理解で、テキスト対話能力は突出しておらず、汎用チャットボットに選ぶのは適切ではありません。

実利用の提案

  • 長動画の空間推論ベースラインとして:自社データセットでGPT-5、Gemini-3-proと比較する。特に注目すべきは120分級の長いストリーミングシーンで、ここが最もリードが明確な場所です
  • ロボットのperceptionモジュールとして:VLAフレームワークと組み合わせる際、spatial memoryをクエリ可能な状態インターフェースとして扱うと、画像embeddingを直接つなぐよりトークンを節約できます
  • 入力の前提に注意:入力が連続的でタイムスタンプ付きの動画ストリームであることを前提としており、画像セット(時系列なし)では優位性が縮みます

💡 ヒント:ECCV 2026の論文とオープンソースコードは継続的に更新されます。SpatialBenchというベンチマーク自体にも注目を——空間知能方向の「デファクトスタンダード」評価セットになりつつあり、早めに慣れておくと自社モデルのベンチマーク比較に役立ちます。

関連記事

Google Geminiリアルタイム翻訳:70以上の言語を聞きながら同時通訳
AI製品

Google Geminiリアルタイム翻訳:70以上の言語を聞きながら同時通訳

GoogleがGemini 3.5 Live Translateを発表。70以上の言語のリアルタイム音声相互翻訳を実現し、話速や抑揚を保持、遅延はわずか数秒。Google TranslateとMeetですでに世界展開されています。

Toolin 編集部
Claude Fable 5:Anthropic最強モデルの実測ガイド
AI製品

Claude Fable 5:Anthropic最強モデルの実測ガイド

AnthropicがClaude Fable 5とMythos 5の2バージョンを発表。SWE-bench Proスコアは80.3%、API価格は入力$10/百万トークン、6月22日まで期間限定で無料です。

Toolin 編集部
OpenAI Codex公式ワークフローガイド:スクリーンショットからのウェブ制作からAI研究まで
AIチュートリアル

OpenAI Codex公式ワークフローガイド:スクリーンショットからのウェブ制作からAI研究まで

OpenAIが公式に十数個のCodex実ワークフロー事例を更新。Computer Use、/goalによる長期目標、PPT生成、ゲーム開発などの実用シーンをカバーし、Codexの効率的な使い方を手取り足取り解説します。

Toolin 編集部
Claude Skillを上手に書くための実戦7カ条
AIチュートリアル

Claude Skillを上手に書くための実戦7カ条

Anthropic公式によるSkill執筆経験のまとめ:コンテキストの簡素化、落とし穴リストの蓄積、安定工程のスクリプト化で、AIとの協働効率を倍増させます。

Toolin 編集部
Codexの中でClaude Codeを同時に走らせる設定方法
AIチュートリアル

Codexの中でClaude Codeを同時に走らせる設定方法

一手でCodexとClaude Codeの二刀流を実現:左でGPTが計画し、右でClaudeが作業。互いにフォールバックし合い、両者の拒答境界が互いに干渉しません。

Toolin 編集部
Kimi K2.7 Code リリース:トークン消費が一気に30%削減
AI製品

Kimi K2.7 Code リリース:トークン消費が一気に30%削減

Moonshot AIがプログラミングモデル「Kimi K2.7 Code」をリリースし、オープンソースとして公開。1.1兆パラメータ、256Kコンテキストを備え、長期タスクでの「考えすぎ」問題が大幅に改善。高速版は6倍の速度で2倍の価格です。

Toolin 編集部