Google Gemma 4 オープンソース化:4段階のモデル、256K コンテキスト、ローカルで動く
Google が Gemma 4 オープンソースモデルファミリー(E2B/E4B/26B MoE/31B Dense)を発表。Apache 2.0 ライセンス、256K コンテキスト、ネイティブマルチモーダルで、ローカル導入の経路も紹介します。


Google Gemma 4 オープンソース化:4段階のモデル、256K コンテキスト、ローカルで動く
Google が Gemma 4 オープンソースモデルファミリー(E2B/E4B/26B MoE/31B Dense)を発表。Apache 2.0 ライセンス、256K コンテキスト、ネイティブマルチモーダルで、ローカル導入の経路も紹介します。
Google は Gemma 4 をリリースしました。現時点で Google 最強のオープンソースモデルファミリーです。クローズドな Gemini 3 と同源ですが、Apache 2.0 ライセンスで提供され、重みをダウンロードして、自分のマシンや自分のクラウドアカウントで動かせ、データはまったくローカル外に出ません。データ主権、オフライン推論、あるいは API 費用の節約が必要な開発者にとって、この世代でついに「先端能力」と「箱から出してすぐローカルで動く」の2つが揃いました。
4つのサイズ、ハードウェアで選ぶ
Gemma 4 は1つのモデルではなく、異なるハードウェアに最適化された4つのバージョンです:
| モデル | タイプ | 適したハードウェア |
|---|---|---|
| E2B | エッジ端末、実効 2B パラメータ | スマホ、Raspberry Pi、NVIDIA Jetson Orin Nano |
| E4B | エッジ端末、実効 4B パラメータ | 同上、能力はより高い |
| 26B MoE | 混合エキスパート、推論時に活性化するのは 3.8B のみ | コンシューマー GPU、低遅延が主眼 |
| 31B Dense | Dense モデル、最大版 | 1枚の 80GB H100。量子化すればコンシューマー GPU でも動作 |
26B MoE バージョンは「低遅延」路線です。総パラメータは 26B ですが、推論時に活性化するのは 3.8B のみで、tokens-per-second が非常に速い。31B Dense は「最高品質 + ファインチューニング基盤」路線です。Google によれば 31B は現在 Arena AI テキストランキングでグローバルオープンソースモデル3位、26B は6位 です。
中核能力
- 長コンテキスト:エッジ版は 128K、26B/31B バージョンは 256K。コードリポジトリ全体や長文ドキュメントを1回の prompt に収められます
- ネイティブマルチモーダル:4バージョンすべてがネイティブで動画と画像を処理(可変解像度、OCR、チャート理解)。E2B/E4B はネイティブ音声入力にも対応
- Agent ワークフロー:関数呼び出し、構造化 JSON 出力、システム指示をネイティブサポートし、自動化 agent 構築に適する
- コード生成:ローカルコードアシスタントとして、オフラインでコードを書ける
- 140以上の言語でネイティブ訓練
- 推論能力:多段階計画と深い論理。数学と指示追従系タスクで顕著な向上
動かし方
Google は導入経路を広く敷いており、ほぼすべての主要なローカル推論スタックをカバーしています:
クラウドで試す(ゼロ設定)
- Google AI Studio:31B と 26B MoE をそのまま実行
- Google AI Edge Gallery:E4B と E2B を実行
ローカル導入
重みは Hugging Face、Kaggle、Ollama で公開され、初日から次に対応しています:
- Hugging Face(Transformers、TRL、Transformers.js、Candle)
- Ollama(
ollama run gemma4:31b-it-q4_K_M) - LM Studio
- vLLM、llama.cpp、MLX
- NVIDIA NIM / NeMo
- Unsloth、SGLang、Cactus、Baseten、Docker、MaxText、Tunix、Keras
Android 開発
エッジモデルは AICore Developer Preview 経由で呼び出せ、Gemini Nano 4 との前方互換性があります。また Android Studio の Agent Mode で agent フローをプロトタイピングすることもできます。
💡 ヒント:手早く試したいだけなら、Ollama の1行コマンドが最速です:
ollama run gemma4:31b-it-q4_K_M。IDE でコードアシスタントにするなら、LM Studio と Continue プラグインの組み合わせが最も使いやすいです。
ファインチューニング
Gemma 4 は設計上、コンシューマーハードウェア(ゲーミング GPU など)でのファインチューニングに対応しています。利用できるプラットフォームは次のとおりです:
- Google Colab(無料/有料)
- Vertex AI
- 自分の GPU
公式は2つのファインチューニング事例を挙げています。INSAIT はこれでブルガリア語優先の BgGPT を訓練し、イェール大学は Cell2Sentence-Scale に使って新しいがん治療経路を発見しました。
エコシステムとハードウェア対応
- NVIDIA:Jetson Orin Nano から Blackwell GPU まで全線で最適化
- AMD:オープンソースの ROCm スタック経由で統合
- TPU:Trillium と Ironwood TPU で大規模導入が可能
- Google Cloud:Vertex AI、Cloud Run、GKE、Sovereign Cloud、TPU による高速推論
ライセンス
Apache 2.0 です。商用にフレンドリーで、利用の敷居はありません。モデルをローカルまたは任意のクラウド環境に導入でき、データは完全に自管理です。これは Google が今回、前の世代より明確に緩めた点です。
誰に向いているか
- データ主権が必要なチーム:金融、医療、行政など、データをサードパーティ API に送れないシーン
- API 費用を節約したい開発者:1度の導入で無制限に呼べる、限界費用はゼロ
- オフラインシーン:モバイル、IoT、ネットワークが不安定な環境
- 研究者:Apache 2.0 + 複数サイズで、実験やファインチューニングが容易
参考ソース
関連記事

Qwen-Audio-3.0-TTS:感情を表現できる音声合成モデル
アリババ Qwen の新世代 TTS モデル。タグで笑い・呼吸・怒りを制御でき、48kHz の映像級サウンド。Speech Arena で世界首位に立った実力を解説します。

Qwen3.8-Max プレビュー版をいち早く試す方法
2.4T パラメータの Qwen フラッグシップのプレビュー版が Token Plan、Qoder、Qwen 公式サイトに登場。公式は総合性能を Fable 5 次点としています。

SenseNova U1 Pro でパノラマインフォグラフィックを作ってみた
SenseTime のフラッグシップ多モーダルモデル U1 Pro の実践チュートリアル。生のデータを、納品可能な 8K インフォグラフィックと戦況パノラマ図へ自動変換します。

Claude for Teachers:全米 K-12 教師に無料で提供される AI チューティングアシスタント
Anthropic が米国の認定 K-12 教師向けに無償公開した AI アシスタント。50 州のカリキュラム標準と接続し、授業準備のアライメント、習熟度別の層別指導、生徒データ分析の 3 つの機能を提供します。

Codex デスクトップペットの作り方完全ガイド:Hatch Pet で動くマスコットを育てる
OpenAI Skills リポジトリの Hatch Pet を使って Codex 用のカスタムデスクトップペットを作る手順。参考画像からインストール・起動まで 5 ステップ、実測では約 1 時間で週間利用量の 60% を消費しました。

n8n ワークフローを Codex Skill に変換する:meta-skill の 5 ステップ パイプライン
n8n-to-codex-skill というメタスキルを使えば、n8n の 10,000 以上ある公開テンプレートを Codex ネイティブの Skill に変換できます。SEO 監査と GEO コンテンツの 2 つの実例つき。