Google Geminiリアルタイム翻訳:70以上の言語を聞きながら同時通訳
GoogleがGemini 3.5 Live Translateを発表。70以上の言語のリアルタイム音声相互翻訳を実現し、話速や抑揚を保持、遅延はわずか数秒。Google TranslateとMeetですでに世界展開されています。


Google Geminiリアルタイム翻訳:70以上の言語を聞きながら同時通訳
GoogleがGemini 3.5 Live Translateを発表。70以上の言語のリアルタイム音声相互翻訳を実現し、話速や抑揚を保持、遅延はわずか数秒。Google TranslateとMeetですでに世界展開されています。
Google は Gemini 3.5 Live Translate を発表しました。リアルタイム通訳を「話し終わってから翻訳」から「聞きながら翻訳」へと前進させています。70 以上の言語のリアルタイム相互翻訳に対応し、遅延はわずか数秒、話者の話速や抑揚も保持します。
Gemini 3.5 Live Translate とは
従来の翻訳ツールの動作はトランシーバーのようなものでした。1文話し終えると、ツールは話し終わるのをじっと待ってから、相手に翻訳します。一往復するたびにリズムが崩れていました。
Gemini 3.5 Live Translate はこの方式を変えました。聞きながら翻訳し、話が終わらないうちに訳声が届きます。モデルは「もう少し待てばより正確に翻訳できる」と「すぐに話し始めて話者に追随する」の間で、一字一句単位で塩梅を調整し、最終的に途切れのない連続的な出力を生み出します。全体で話者に数秒遅れるだけです。
コア能力
- 聞きながら翻訳:話し終わるのを待たずに、リアルタイムで訳文を出力
- 音声特徴の保持:翻訳後の声もあなたの話速、ピッチ、抑揚を保持し、無機質な機械音ではない
- 70 以上の言語に対応:全自動で識別し、途中で言語を切り替えても追随します
- ノイズ耐性:市場、空港、道路脇でも使える

同モデルは Gemini 3 Pro をベースに構築され、最長 128K トークンの音声コンテキストを処理できます。評価では翻訳品質、遅延、音声の自然さの3つの指標に焦点を当てています。
使い方
3つの製品ラインが同時に展開され、異なるユーザー層をカバーします:
一般ユーザー:Google Translate
Google Translate の Android 版と iOS 版はすでに世界展開されています。
アプリ左下の「リアルタイム翻訳」を開き、任意のイヤホンを接続すれば使えます。Android には「リスニングモード」もあります。スマホを電話のように耳に当てると、訳声が受話器から直接届き、周囲には聞こえません。

企業ユーザー:Google Meet
今月から Google Meet はプライベートベータ段階に入ります。以前は5つの言語のみ対応でしたが、今回は一気に70以上まで引き上げ、1回の会議で2000以上の言語の組み合わせを支えられます。
開発者:Gemini Live API
Gemini Live API と Google AI Studio のパブリックベータを通じて、今日から使い始められます。Agora、Fishjam、LiveKit などのプラットフォームがすでに接続しており、リアルタイムメディアストリームのインフラを丸ごと引き受けてくれます。

音声翻訳は Google が最も長く走り続けている機械学習プロジェクトの1つですが、ついに今回はイヤホンの中まで走り込みました。 -- Jeff Dean、Google DeepMind チーフサイエンティスト
既知の制限
現時点では音声入力のみを受け付けます。強い訛り、言語の高速な往復切り替え、複数人が同時に話す場合、長時間の沈黙では、声の再現が不安定になることがあります。
実際のシーン
東南アジアの配車プラットフォーム Grab がすでに試用を始めています。運転手が現地の言葉を話し、乗客は自分の母語で聞きます。Grab ユーザーは毎月1000万回を超える音声通話を行っており、これは発表会のデモではなく、実際のビジネスシーンです。
あなたに合うシーン:言語の異なる会議、海外旅行でのコミュニケーション、多言語カスタマーサポート、オンライン授業、動画の吹き替え、多言語配信。
入手方法
- Google Translate:Android/iOS アプリ、左下の「リアルタイム翻訳」
- Google Meet:今月プライベートベータ
- Gemini Live API:Google AI Studioでパブリックベータ
- モデルカード:Gemini 3.5 Audio Model Card
関連記事

LingBot-World 2.0:オープンソースで遊べる無限長時間の対話型世界モデル
Ant Group傘下のRobbyantがLingBot-World-Infinityをオープンソース化。720p/60fps・時間単位のリアルタイム生成で、内蔵Agentがイベントを自動提案し、「動画を見る」が「世界に入る」に変わる。

2つのオープンソースSkill:Codex/Claude Codeに記事の図解とWebデザインを任せる
オープンソースのguizang-material-illustration記事図解Skillとweb-design-taste WebデザインSkill。コマンド1行でCodexに入れて、AI臭い図解とワンパターンなWebページにサヨナラ。

Tencent混元Hy3正式版:GLM-5.2に比肩する中国産Coding Agentモデル
Tencent混元Hy3正式版が登場。295B MoEアーキテクチャ、Agentタスク成功率は90%へ向上、API価格は1人民元/100万トークンで、WorkBuddy内では期間限定無料トライアル中。

Vidu S1:デジタルヒューマンとリアルタイム対話するオープンソース級の対話型動画モデル
生数科技のVidu S1がリアルタイム音声駆動の動画生成を実現。540P/25FPSでコンシューマーGPUでも動き、画像1枚が瞬時に会話できるデジタルヒューマンに変わる。

Codexの3つのコンピュータ操作モード使いこなしガイド
CodexのComputer Use、Chrome拡張、アプリ内ブラウザという3つの操作モードにはそれぞれ適したシーンがある。本記事では権限体系を分解し、ベストプラクティスを示す。

Codexオープンソースモード:設定1行でローカルモデルに接続
OpenAI CodexにOSSモードが追加され、model_providers設定でOllamaやLM Studioなどのローカルモデルサービスに接続可能になった。モデルを切り替えてコストを削減できる。