ChatGPT音声の大規模アップグレード:全二重のGPT-Liveモード登場

·Toolin 編集部

OpenAIが全二重音声モデルGPT-Liveをリリース。ChatGPTがついに聞きながら話し、自然に相槌を打ち、沈黙のタイミングを知るようになった。従来のAdvanced Voice Modeを置き換える。

ChatGPT音声の大規模アップグレード:全二重のGPT-Liveモード登場

ChatGPTとの音声チャットで、こんな穴にハマったことがあるはずだ:話の途中で言葉を探して止まると、言い終わったと勘違いして、まくしたてるように喋り始める。あるいは周囲に車の音や人の声があると、どれが自分の声か区別できない。2026年7月8日、OpenAIは GPT-Live 全二重音声モデルファミリーを正式リリースし、従来のAdvanced Voice Mode(高度な音声モード)をそのまま置き換えた。これでChatGPTはついに、真人のように——聞きながら話し、自然に相槌を打ち、いつ黙るべきかを知る。音声でAIとやり取りする機会が多い人にとって、今回の更新は体感の変化が非常に大きい。

GPT-Liveとは

GPT-LiveはOpenAIの第3世代音声モデルで、GPT-Live-1(有料ユーザー)と GPT-Live-1 mini(無料ユーザー)の2つのバージョンがあり、世界中のiOS、Android、ChatGPT.comに配信済みだ。

中核的なブレークスルーは全二重アーキテクチャ(full-duplex):モデルはあなたの入力音声を処理し続けながら、同時に自分の音声応答を生成する。OpenAIは研究ブログでこう説明している——

「GPT-Liveは入力の処理と出力の生成を同時に行い、モデルは毎秒数十回の意思決定をする。話す?聴き続ける?一旦止まる?割り込む?それともツールを呼ぶ?」

3世代の音声モードの進化

GPT-Liveのどこがすごいかを理解するには、まず過去2世代がどれほど不器用だったかを見よう。

第1世代:トランシーバー(2023)

3モデルのリレー戦——Whisperがあなたの話を文字に起こし、GPT-4が文字の返答を生成し、TTSで音声に戻す。どのステップでも情報が落ち、口調、間、感情は中間段階ですり減り、レイテンシは2秒近かった。

第2世代:電話(2024年9月)

Advanced Voice Modeは3モデルのパイプラインを単一モデルによる音声のネイティブ処理に圧縮し、かなり速くなった。だが致命傷はターン制:あなたが言い終わるまで待たないと話せず、「言い終わったか」の判断材料は沈黙だった。息継ぎで一瞬止まると、自分の番だと勘違いするのだ。

第3世代:対面チャット(GPT-Live)

全二重により、ChatGPTはあなたが話している途中に「うんうん」「そう」「わかる」と自然に相槌を打てる。考え事で止まると、話を奪わず静かに待つ。「ちょっと黙ってて」と言えば本当に黙って聴き続け、ウェイクワード「Hey Chat」で呼ばれるまで戻ってこない。背景ノイズの中でも、どれがあなたの声か見分けられる。

フロントとバックの分業:おしゃべりはおしゃべりに、思考は思考に

GPT-Liveのもう1つの重要なアーキテクチャ変化は、音声レイヤーと推論レイヤーの分離だ。

  • フロント:GPT-Live自身が雑談、相槌、会話リズムの維持を担当
  • バック:ネット検索、深い推論、複雑なagent作業が必要な問題に当たると、こっそりタスクをGPT-5.5(OpenAI現行フラッグシップモデル)に投げ、自分はあなたとの会話を続け、結果が整い次第自然に会話へ織り戻す

OpenAIは、今後より強いフロンティアモデルをリリースする際、GPT-Liveのバックが呼ぶモデルを継続的に差し替え、フロントの体験は変えなくてよいとしている。これはモジュラー設計だ——音声インタラクションと推論能力を独立にアップグレードできる。

実際に何ができるか

全二重 + フロント/バックの分業をベースに、GPT-Liveは旧音声モードでは不可能だった一連のシーンを解放した:

  • 自然な割り込み相槌:話が盛り上がると「うんうん」と相槌を打ち、考え込んで止まると静かに待つ
  • リアルタイム翻訳:中国語で話すあなたの声を聴きながら、英語を吐き出し続ける。ターン制時代には不可能だった
  • ノイズ頑健性:横を車が通り過ぎ、誰かが話していても、あなたの声にフォーカスできる
  • 3段階の推論強度:Instant(即答)、Medium(中程度の思考)、High(複雑タスク)
  • ビジュアルカード:音声会話の中に天気、株価、スポーツ、地図などの情報カードが浮かび、話すリズムを切らさない

OpenAIの開示によると、現在毎週 1.5億人 がChatGPTの音声・ディクテーション機能を使っている。

💡 ヒント:GPT-Liveの登場に伴い、動画/画面共有機能は削除された(旧版Advanced Voice Modeは対応)。公式は数週間で復活させると述べている。「カメラを見ながら話す」シーンに依存している人は、しばらく待つ必要がある。

使い方

  • 有料ユーザー(Go / Plus / Proプラン):デフォルトでGPT-Live-1を使用
  • 無料ユーザー:GPT-Live-1 miniを使用
  • プラットフォーム:iOS、Android、ChatGPT.comに全世界で配信済み。従来の音声モードをそのまま置き換え

APIは未開放で、開発者は登録して通知を待つことになる。

中国語体験を冷やす2つのポイント

第一に、中国語の体験は疑問が残る。OpenAIが発表イベントでリアルタイム翻訳を実演した際、出力されたヒンディー語を記者に「アメリカ訛り全開で、教科書を読んでいるようだ」とダメ出しされた。公式は「大多数の常用言語」を最適化したと言うが、リストはなく、中国語の実際の水準は自分で試す必要がある。

第二に、全二重のレースではOpenAIがリードとは言えない。GoogleのGemini Live、ByteDanceのDoubao Seeduplex(4月提供開始)、NvidiaのPersonaPlex(1月提供開始)がすでに全二重対応で、しかもGemini Liveはカメラ/画面共有にも対応している——これはGPT-Liveに今ないものだ。今回のリリースは「追いつき」であって、「リード」ではない。

安全設計

GPT-Liveのsystem cardは、リアルタイム音声シーンに向けた安全ポリシーを開示している:実際のユーザー音声サンプル(opt-in)と合成した対抗的プロンプトで評価を行い、自傷、性的コンテンツ、違法行為、感情的依存、メンタルヘルス、ヘイトスピーチなどのカテゴリをカバーした。Advanced Voice Modeと比べ、GPT-Live-1は違法行為の安全スコアが0.63から0.97へ、自傷が0.72から0.98へ向上し、ヘイトスピーチは1.00に達した。

OpenAIはまた「AIパートナーは作らない」と特に強調し、感情的依存への長期モニタリングを行うとしている——自然な会話であるほど、人はハマりやすいからだ。

関連記事

Seko の無限キャンバス:ひとつのアイデアから武侠大作を生成
AIチュートリアル

Seko の無限キャンバス:ひとつのアイデアから武侠大作を生成

Seko は Seedance 2.0 全能モードを搭載し、Agent ワークフローで脚本・キャラクター・絵コンテを自動生成。720P のコストは 50% ダウンで、10 分で作品が完成します。

Toolin 編集部
Claude Science:研究界の Claude Code、無料のオープンソース代替もあわせて紹介
AI製品

Claude Science:研究界の Claude Code、無料のオープンソース代替もあわせて紹介

Anthropic が研究向け AI ワークベンチ Claude Science を発表。60 以上のスキルを内蔵し、再現可能です。あわせて DeepSeek/GLM 対応のオープンソース代替 OpenScience も紹介します。

Toolin 編集部
DeepSeek Deep Code:Claude Code の中国製ターミナル代替
AI製品

DeepSeek Deep Code:Claude Code の中国製ターミナル代替

DeepSeek が公式に推奨するオープンソースのターミナルコーディング Agent、Deep Code。深い思考、推論強度の調節、Agent Skills に対応し、3 ステップで使い始められます。

Toolin 編集部
Doubao プロ版の有料化:3 段階料金を分解して、本当に価値があるかを検証
AI製品

Doubao プロ版の有料化:3 段階料金を分解して、本当に価値があるかを検証

Doubao プロ版が 68 / 200 / 500 元の 3 段階で登場。中核は 2.1 Pro を組み込んだオフィスタスクモードです。本稿では料金、枠、そして価値の有無を分解します。

Toolin 編集部
Codex Security Plugin:OpenAI でワンクリック、コードの脆弱性をスキャン
AI製品

Codex Security Plugin:OpenAI でワンクリック、コードの脆弱性をスキャン

OpenAI が Codex Security プラグインを発表。Codex 内でワンクリックによりコードの脆弱性をスキャンし、悪用可能性を検証して修正案を提示します。完全な導入手順も併せて紹介します。

Toolin 編集部
Seedream 5.0 Pro:ByteDance 最強の画像モデル、API が正式に公開
AI製品

Seedream 5.0 Pro:ByteDance 最強の画像モデル、API が正式に公開

ByteDance の画像モデル Seedream 5.0 Pro が Volcano Engine API で利用可能に。部分編集の精密さ、14 言語のテキスト生成、レイヤー分離が武器です。

Toolin 編集部