Google Gemma 4 オープンソース化:4段階のモデル、256K コンテキスト、ローカルで動く

·Toolin 編集部

Google が Gemma 4 オープンソースモデルファミリー(E2B/E4B/26B MoE/31B Dense)を発表。Apache 2.0 ライセンス、256K コンテキスト、ネイティブマルチモーダルで、ローカル導入の経路も紹介します。

Google Gemma 4 オープンソース化:4段階のモデル、256K コンテキスト、ローカルで動く

Google は Gemma 4 をリリースしました。現時点で Google 最強のオープンソースモデルファミリーです。クローズドな Gemini 3 と同源ですが、Apache 2.0 ライセンスで提供され、重みをダウンロードして、自分のマシンや自分のクラウドアカウントで動かせ、データはまったくローカル外に出ません。データ主権、オフライン推論、あるいは API 費用の節約が必要な開発者にとって、この世代でついに「先端能力」と「箱から出してすぐローカルで動く」の2つが揃いました。

4つのサイズ、ハードウェアで選ぶ

Gemma 4 は1つのモデルではなく、異なるハードウェアに最適化された4つのバージョンです:

モデルタイプ適したハードウェア
E2Bエッジ端末、実効 2B パラメータスマホ、Raspberry Pi、NVIDIA Jetson Orin Nano
E4Bエッジ端末、実効 4B パラメータ同上、能力はより高い
26B MoE混合エキスパート、推論時に活性化するのは 3.8B のみコンシューマー GPU、低遅延が主眼
31B DenseDense モデル、最大版1枚の 80GB H100。量子化すればコンシューマー GPU でも動作

26B MoE バージョンは「低遅延」路線です。総パラメータは 26B ですが、推論時に活性化するのは 3.8B のみで、tokens-per-second が非常に速い。31B Dense は「最高品質 + ファインチューニング基盤」路線です。Google によれば 31B は現在 Arena AI テキストランキングでグローバルオープンソースモデル3位、26B は6位 です。

中核能力

  • 長コンテキスト:エッジ版は 128K、26B/31B バージョンは 256K。コードリポジトリ全体や長文ドキュメントを1回の prompt に収められます
  • ネイティブマルチモーダル:4バージョンすべてがネイティブで動画と画像を処理(可変解像度、OCR、チャート理解)。E2B/E4B はネイティブ音声入力にも対応
  • Agent ワークフロー:関数呼び出し、構造化 JSON 出力、システム指示をネイティブサポートし、自動化 agent 構築に適する
  • コード生成:ローカルコードアシスタントとして、オフラインでコードを書ける
  • 140以上の言語でネイティブ訓練
  • 推論能力:多段階計画と深い論理。数学と指示追従系タスクで顕著な向上

動かし方

Google は導入経路を広く敷いており、ほぼすべての主要なローカル推論スタックをカバーしています:

クラウドで試す(ゼロ設定)

  • Google AI Studio:31B と 26B MoE をそのまま実行
  • Google AI Edge Gallery:E4B と E2B を実行

ローカル導入

重みは Hugging Face、Kaggle、Ollama で公開され、初日から次に対応しています:

  • Hugging Face(Transformers、TRL、Transformers.js、Candle)
  • Ollama(ollama run gemma4:31b-it-q4_K_M)
  • LM Studio
  • vLLM、llama.cpp、MLX
  • NVIDIA NIM / NeMo
  • Unsloth、SGLang、Cactus、Baseten、Docker、MaxText、Tunix、Keras

Android 開発

エッジモデルは AICore Developer Preview 経由で呼び出せ、Gemini Nano 4 との前方互換性があります。また Android Studio の Agent Mode で agent フローをプロトタイピングすることもできます。

💡 ヒント:手早く試したいだけなら、Ollama の1行コマンドが最速です:ollama run gemma4:31b-it-q4_K_M。IDE でコードアシスタントにするなら、LM Studio と Continue プラグインの組み合わせが最も使いやすいです。

ファインチューニング

Gemma 4 は設計上、コンシューマーハードウェア(ゲーミング GPU など)でのファインチューニングに対応しています。利用できるプラットフォームは次のとおりです:

  • Google Colab(無料/有料)
  • Vertex AI
  • 自分の GPU

公式は2つのファインチューニング事例を挙げています。INSAIT はこれでブルガリア語優先の BgGPT を訓練し、イェール大学は Cell2Sentence-Scale に使って新しいがん治療経路を発見しました。

エコシステムとハードウェア対応

  • NVIDIA:Jetson Orin Nano から Blackwell GPU まで全線で最適化
  • AMD:オープンソースの ROCm スタック経由で統合
  • TPU:Trillium と Ironwood TPU で大規模導入が可能
  • Google Cloud:Vertex AI、Cloud Run、GKE、Sovereign Cloud、TPU による高速推論

ライセンス

Apache 2.0 です。商用にフレンドリーで、利用の敷居はありません。モデルをローカルまたは任意のクラウド環境に導入でき、データは完全に自管理です。これは Google が今回、前の世代より明確に緩めた点です。

誰に向いているか

  • データ主権が必要なチーム:金融、医療、行政など、データをサードパーティ API に送れないシーン
  • API 費用を節約したい開発者:1度の導入で無制限に呼べる、限界費用はゼロ
  • オフラインシーン:モバイル、IoT、ネットワークが不安定な環境
  • 研究者:Apache 2.0 + 複数サイズで、実験やファインチューニングが容易

参考ソース

関連記事

Qwen-Audio-3.0-TTS:感情を表現できる音声合成モデル
AI製品

Qwen-Audio-3.0-TTS:感情を表現できる音声合成モデル

アリババ Qwen の新世代 TTS モデル。タグで笑い・呼吸・怒りを制御でき、48kHz の映像級サウンド。Speech Arena で世界首位に立った実力を解説します。

Toolin 編集部
Qwen3.8-Max プレビュー版をいち早く試す方法
AI製品

Qwen3.8-Max プレビュー版をいち早く試す方法

2.4T パラメータの Qwen フラッグシップのプレビュー版が Token Plan、Qoder、Qwen 公式サイトに登場。公式は総合性能を Fable 5 次点としています。

Toolin 編集部
SenseNova U1 Pro でパノラマインフォグラフィックを作ってみた
AIチュートリアル

SenseNova U1 Pro でパノラマインフォグラフィックを作ってみた

SenseTime のフラッグシップ多モーダルモデル U1 Pro の実践チュートリアル。生のデータを、納品可能な 8K インフォグラフィックと戦況パノラマ図へ自動変換します。

Toolin 編集部
Claude for Teachers:全米 K-12 教師に無料で提供される AI チューティングアシスタント
AI製品

Claude for Teachers:全米 K-12 教師に無料で提供される AI チューティングアシスタント

Anthropic が米国の認定 K-12 教師向けに無償公開した AI アシスタント。50 州のカリキュラム標準と接続し、授業準備のアライメント、習熟度別の層別指導、生徒データ分析の 3 つの機能を提供します。

Toolin 編集部
Codex デスクトップペットの作り方完全ガイド:Hatch Pet で動くマスコットを育てる
AIチュートリアル

Codex デスクトップペットの作り方完全ガイド:Hatch Pet で動くマスコットを育てる

OpenAI Skills リポジトリの Hatch Pet を使って Codex 用のカスタムデスクトップペットを作る手順。参考画像からインストール・起動まで 5 ステップ、実測では約 1 時間で週間利用量の 60% を消費しました。

Toolin 編集部
n8n ワークフローを Codex Skill に変換する:meta-skill の 5 ステップ パイプライン
AIチュートリアル

n8n ワークフローを Codex Skill に変換する:meta-skill の 5 ステップ パイプライン

n8n-to-codex-skill というメタスキルを使えば、n8n の 10,000 以上ある公開テンプレートを Codex ネイティブの Skill に変換できます。SEO 監査と GEO コンテンツの 2 つの実例つき。

Toolin 編集部