Google が軽量クリエイションモデルを2本公開:4秒で画像、10秒で動画

·Toolin 編集部

Googleが画像モデル Nano Banana 2 Lite と動画モデル Gemini Omni Flash をリリース。速さと安さが主役で、1枚0.034ドル、動画は0.10ドル/秒。Gemini App、YouTube Shorts に組み込まれ無料公開

Google が軽量クリエイションモデルを2本公開:4秒で画像、10秒で動画

6月30日、Googleは軽量クリエイションモデルを2本公開しました。画像モデルNano Banana 2 Lite(技術コードネーム Gemini 3.1 Flash-Lite Image)と、動画モデルGemini Omni Flashです。1つは「速さ」、もう1つは「コスト」が主役で、すでにGemini App、Google Flow、YouTube Shorts、YouTube Createに組み込まれ、無料で開放されています。AIアプリや画像・動画生成のワークフローを扱っている人にとって、この2つのモデルが解決する核心的な問いは「十分に速いか、十分に安いか、既存のパイプラインに組み込めるか」です。

モデル1:Nano Banana 2 Lite——4秒で1K画像を1枚

Nano Bananaシリーズの最新派生モデルで、ファミリー全体で最速・最安のモデルです。4秒で1K画像を1枚生成し、単価は0.034ドルまで抑えられます。位置づけは高速なビジュアルスケッチと高頻度A/Bテスト用の画像生成——もし作っているAIアプリがクリック1回ごとに15秒待たされて画像が出るなら、離脱率が痛いほど高いはずで、このモデルはまさにその問題を解決しに来たものです。

性能面ではElo 1255を獲得して5位につけ、Nano Banana Proを上回りました。高速ビジュアルスケッチと高頻度の画像生成テストに向きます。

モデル2:Gemini Omni Flash——対話式で動画を編集

新設の「Omni」ファミリー最初のメンバーで、位置づけは対話式の動画編集です。元動画のカメラワークとリズムを保ったまま、部分修正を完了できます。Interactions API経由で最大3ラウンドの連続編集に対応し、各ラウンドは前のコンテキストを保持します。

Google公式のデモでは、一人の女性がスマホで自撮りをし、Omni Flashがその動画に段階的にエフェクトを重ねていきます——スマホ画面の中から3Dのバルーン文字を引っ張り出す、画面の水をグラスに「注ぐ」——3ラウンドの編集がそれぞれ前ラウンドの結果の上に構築され、キャラクター、光、物理法則がすべて一貫したまま保たれます。

差別化は「統一」という2文字です。テキスト、画像、音声、動画が同一のマルチモーダル理解として処理され、Geminiが自前で持つ世界知識が下支えし、さらにYouTube ShortsやSearchといった10億級トラフィックの入口に直接組み込める配信力が加わります。

2つのモデルで1本のパイプライン

Googleはこの2つのモデルを直列で使えるように設計しました。

  1. まずNano Banana 2 Liteで数秒のうちに決定版の1枚を生成する
  2. 次にOmni Flashへ渡して静止画を「動かす」
  3. その後は自然言語で複数ラウンド修正する

公式はこのワークフローを見せる3つのデモアプリを用意しています。

  • Anywhere(自撮り+ランドマーク合成+動画生成):自撮りを1枚アップロードすると、NB2 Liteがあなたを世界中のランドマークの前に合成し、Omni Flashをワンタップで静止画から動く動画に変える
  • Space Lift(部屋のデザイン案+動画プレビュー):部屋の写真を撮ると複数のインテリア案が自動生成され、選んだ案をワンクリックで動画に変換して効果を確認できる
  • Omni Product Studio(商品画像→EC動画):静止画の商品画像をそのままECグレードの動画広告に変換

価格比較

画像モデルでは、Nano Bananaファミリーの3段階の位置づけが明快です。

モデル単価速度適用シーン
Nano Banana 2 Lite1枚0.034ドル4秒高速スケッチ、A/Bテスト
Nano Banana 21枚0.067ドル4-8秒画質と編集のバランス
Nano Banana Pro1枚0.134ドル10-20秒複雑なシーン、極限のディテール

OpenAIのGPT Image 2(トークン課金、1024×1024中画質で約1枚0.053ドル、高画質で約1枚0.211ドル)と比べると、NB2 Liteは価格と速度の両面で優位に立ちます。

動画側では、Omni Flashの価格は0.10ドル/秒で、同価格のVeo 3.1 Fast、そして同じく0.10ドル/秒のOpenAI Sora 2 Standard 720p帯と対比されます。横並びで見ると、ByteDanceのJimeng、KuaishouのKlingなどは5秒動画でどこも0.4ドル前後で、秒あたりに換算するとだいたい0.1ドル——Omni Flashの「コスパ」の看板はこの次元では並みです。

既知の弱点

Omni Flashはドキュメントでいくつかの制限を認めています。

  • 音声参照は未対応
  • シーンの延長は未対応
  • 3秒以内の動画参照は「APIは受け付けるがモデルはまだうまく処理できない」

コミュニティのフィードバックも指摘しています。複雑なレイアウトでの中国語テキストのレンダリングは今でもエラーが出る、生成画像にはたまに指が6本あるお馴染みの欠点が残る、ピーク時に30秒以上の待ちが発生して「4秒で画像生成」の看板と合わない、水彩や油絵などの芸術スタイル変換は安定感を欠く。Adobeはすでにこの2つのモデルをFireflyに接続しており、WPP、Figma、Invideo、Artlistが初期導入側です。

誰に向くか

  • AIアプリ開発者:画像生成レイテンシと単価を気にし、モデルをプロダクトのワークフローに組み込む必要がある人
  • コンテンツクリエイター:高速スケッチ、静止画の動画化、ビジュアル案の反復が必要な人
  • EC/マーケティングチーム:商品画像からEC動画へ。Omni Product Studioのデモワークフローをそのまま流用できる

旗艦モデルが能力の天井を解決するのに対し、この2つの軽量モデルが解決するのはもう1つの問題——「十分に速いか、十分に安いか、既存のワークフローに組み込めるか」です。AIという業界で最後に勝つのは、一番高くジャンプできるものではなく、あなたのワークフローに先に入り込んだものです。

関連記事

Meshy:20秒でテキストと画像を実用的な3Dモデルに変える
AI製品

Meshy:20秒でテキストと画像を実用的な3Dモデルに変える

AI の text/image-to-3D ツール。2ステップワークフローに対応し、FBX/OBJ/GLB/STL を書き出せ、公式 API とプラットフォームプラグインを提供しています。

Toolin 編集部
Qwen-Image-3.0:Alibaba Qwen の第3世代画像生成モデル
AI製品

Qwen-Image-3.0:Alibaba Qwen の第3世代画像生成モデル

4.5k token の超長入力、10px 級の小文字までクリアにレンダリング、12言語に対応。ポスター、試験問題、コマ割り漫画などの複雑なレイアウトを一発で出力できます。

Toolin 編集部
Qwen 3.8 で Reddit 自動の海外顧客獲得ワークフローを組む
AIチュートリアル

Qwen 3.8 で Reddit 自動の海外顧客獲得ワークフローを組む

8ステップ完全自動フロー: Apify で投稿取得、Qwen 3.8 が採点/執稿/自己審査/振り返り。260 件の投稿から 22 件のチャンスをふるい出し、コストは 10 分の 1 に削減。

Toolin 編集部
Qwen-Audio-3.0-TTS:感情を表現できる音声合成モデル
AI製品

Qwen-Audio-3.0-TTS:感情を表現できる音声合成モデル

アリババ Qwen の新世代 TTS モデル。タグで笑い・呼吸・怒りを制御でき、48kHz の映像級サウンド。Speech Arena で世界首位に立った実力を解説します。

Toolin 編集部
Qwen3.8-Max プレビュー版をいち早く試す方法
AI製品

Qwen3.8-Max プレビュー版をいち早く試す方法

2.4T パラメータの Qwen フラッグシップのプレビュー版が Token Plan、Qoder、Qwen 公式サイトに登場。公式は総合性能を Fable 5 次点としています。

Toolin 編集部
SenseNova U1 Pro でパノラマインフォグラフィックを作ってみた
AIチュートリアル

SenseNova U1 Pro でパノラマインフォグラフィックを作ってみた

SenseTime のフラッグシップ多モーダルモデル U1 Pro の実践チュートリアル。生のデータを、納品可能な 8K インフォグラフィックと戦況パノラマ図へ自動変換します。

Toolin 編集部