Codexの3つのコンピュータ操作モード使いこなしガイド
CodexのComputer Use、Chrome拡張、アプリ内ブラウザという3つの操作モードにはそれぞれ適したシーンがある。本記事では権限体系を分解し、ベストプラクティスを示す。


Codexの3つのコンピュータ操作モード使いこなしガイド
CodexのComputer Use、Chrome拡張、アプリ内ブラウザという3つの操作モードにはそれぞれ適したシーンがある。本記事では権限体系を分解し、ベストプラクティスを示す。
OpenAIのエンジニアJason Liuがある事例を共有した:ネット通販の荷物が盗まれ、カスタマーサポートに問い合わせると予想待ちは25分。彼はこの件をCodexに任せ、指示は「5分ごとにチャットウィンドウを確認し、サポートがオンラインになったら毎分確認に変え、できるだけ返金を完了させて」の一点張り。そしてシャワーを浴びに行った。戻ってきたときには、返金はすでに済んでいた。その背景にあるのは、Codexの3つの「コンピュータ操作能力」——Computer Use、Chrome拡張、アプリ内ブラウザだ。機能が重なって見えるが、実際には入念に設計された行動権限の体系にそれぞれ対応している。
3つのモードはそれぞれ何か
この3つのモードはいずれも、Codexにコンピュータを任せる能力だが、権限の範囲と適したシーンはまったく異なる。簡単に言えば:プラグインで済むならWebページをクリックさせず、直接APIを呼べるなら、AIに画面認識でUIを操作させないことだ。

Computer Use:最も広い門
能力が最も大きいモード。画面を見て、ほぼどんなグラフィカルUIでも操作し、キーボードとメニューを使い、あなたが認可したAppとやり取りできる。APIのないソフトウェアでもそのまま使え、「画面を見て、どこをクリックすべきかを自分で判断する」ことに完全に依存している。

代償は遅さだ。 構造化されたプラグインならインターフェースを1回呼ぶだけで済むが、Computer Useはまず画面を読み取り、クリック先を判断し、Appの反応を待ち、次の画面を見る——この視覚ループがかなり時間を浪費する。
適したシーン:
- Spotifyのようなネイティブデスクトップアプリや金融アプリ
- iOSシミュレーター、iPhoneミラーリング、その他の純粋なGUIフロー
- システムやアプリケーションの設定
- プラグインもAPIもないデータソース
- 複数のアプリの間を切り替えて進めるワークフロー
- 他の構造化統合に1ステップ足りないときの埋め合わせ
💡 ヒント:一度に与えるのは明確なAppかフロー1つだけ。お金、アカウント、パスワード、プライバシー、システムセキュリティに関わる操作では、そばについていること。
Chrome拡張:あなたの身分を帯びた門
任せるのは、あなたがすでにログイン済みのブラウザだ。Cookie、設定、ログイン状態、開いているタブ、これらをすべて使える。Gmail、LinkedIn、Salesforce、社内のバックオフィス——こうした、ログインしないとアクセスできないWeb上の情報は、Chromeに任せられる。
決定的な違い:Chromeはあなたの身分を帯びて動くため、Webサイトはそのクリック、送信、メッセージをあなた本人の操作とみなす。能力はより強いが、リスクもより大きい。
適したシーン:
- GmailやLinkedIn
- Salesforceやサポートコンソール
- 社内ダッシュボード
- 複数サイトにまたがる権威ある調査
- あなたのアカウントやブラウザ拡張機能に依存するフォーム
アプリ内ブラウザ:きれいに隔離された門
Codexの会話の中で、あなたとCodexは同じレンダリング結果のページを見ている。普段のブラウザ設定もCookieもプラグインもログイン状態も使わない。
適したシーン:
- ローカル開発サーバー
- ファイルのプレビュー
- ログイン不要の公開ページ
- 見た目のバグの再現
- レスポンシブレイアウトの確認
- 要素レベルのデザインフィードバックを残す
最も面白いのは注釈機能だ:ローカルページをレビューするとき、要素を直接クリックするか領域を囲んで、「この階層は逆」「このブロックはカードにしないで」と一言残せる。Codexはスクリーンショットと要素のコンテキスト付きのコメントを受け取り、ファイルを修正してから同じページを開き、次の版を見せてくれる。
ベストプラクティス
OpenAI自身のベストプラクティスが指すのは、直感に反する方向だ:人間のようにクリックするのは、最も遅く、最も壊れやすく、信頼コストが最も高い道である。本当に必要なのは、Agentに十分に構造化されたインターフェースを与え、クリックしなくて済むようにすることだ。
| シーン | 推奨モード | 理由 |
|---|---|---|
| ネイティブデスクトップAppの操作 | Computer Use | APIがなく、視覚操作しか手段がない |
| ログインが必要なWebタスク | Chrome拡張 | ログイン状態を帯びており、サイトは本人とみなす |
| ローカル開発とデバッグ | アプリ内ブラウザ | きれいに隔離され、注釈も付けられる |
| 複数Appの横断切り替え | Computer Use | これだけがアプリを横断できる |
| 構造化統合に1ステップ不足 | Computer Use | 埋め合わせとして「ファイルを追加」を1クリック |
補足:Appshots
4つ目の関連機能が Appshots だ。macOSでは、どんなシーンでもスペースキーの左右両脇にある2つのCommandキーを同時に押すと、ウィンドウのスクリーンショットとウィンドウのコンテキスト情報が自動でCodexに送られる。
Appshotsは指し示す役割、Browser、Chrome、Computer Useは手を動かす役割だ。AppshotsでCodexに「ここを見て」と伝え、それから適切な操作モードに実行させる。
よくある質問
- 3つのモードは同時に使えるか:使える。1つのタスクの中で、CodexはまずChromeでメールを読み、次にComputer UseでローカルAppを操作し、最後にアプリ内ブラウザで結果をプレビューできる。タスクの段階に応じて自動で切り替わる。
- Chromeモードは安全か:あなたのログイン状態を帯びるため、リスクが最も大きい。読み取りと情報の整理だけに使うことを推奨したい。送信や投入などの操作では、Codexにまず下書きさせ、あなたが確認してから実行させる。
- アプリ内ブラウザでGoogleにログインできるか:ほぼできない。Cookieとログイン状態を持たないため、Googleログイン、passkey、ブラウザ拡張に依存するサイトの処理は失敗する。
関連記事

VLA-JEPA:ロボットに「動作が世界をどう変えるか」を学ばせる
中関村学院 × 中科大 × 上交 × 東方理工がVLA-JEPAを提案。VLAモデルと世界モデルを潜在空間で融合し、わずか13軌跡で組立タスクを完了、LIBEROで97.2%を達成、LeCunと謝賽寧氏が転載しました。

AutoControl-Arena:実行可能なAgentリスク試験場を自動生成する
復旦大学 × 創智 × オックスフォードがICML 2026論文AutoControl-Arenaを共同発表。実行可能なテスト環境を自動合成してAgentのロングテールシナリオでの潜在リスクを発見し、Anthropic/OpenAI安全報告の再現で相関係数0.87を達成。

Nvidia Halos:ロボットにオープンソースの安全OSを搭載する
NvidiaはAutomate 2026でフルスタックのロボット安全システム「Halos for Robotics」を発表。自動運転分野で蓄積した18600エンジニア人年と検証済みコードを身体知能業界にオープンソースとして公開し、コアの安全フレームワークは開放済み、43社が参加しています。

PerfEvolve:AgentにベテランDBAのようにデータベースパラメータを調整させる
中国科学院ソフトウェア研究所がPerfEvolveフレームワークをオープンソース化。静的なパラメータ調整ドキュメントをAgentが実行可能な手続き的スキルへ変換し、PostgreSQL v16で最大58.9%の性能向上を実現。LLMの調整失敗に効く特効薬です。

Spatial-TTT:2Bパラメータのオープンソース空間知能モデル
清華大学がオープンソース化したSpatial-TTTがECCV 2026に採択。わずか2Bパラメータで複数の空間知能ベンチマークにおいてGPT-5、Gemini-3-proを上回り、120分のストリーミング動画を処理し、観ながら空間記憶を更新できます。

TerminalWorld:初の実CLIワークフローAgentベンチマーク
8万件の人間のターミナル録画から鍛え上げられた1530タスクの評価セット。18類のワークフロー、1280個のコマンドツールをカバーし、Agentが実ターミナルシーンで「ランキング高得点、実投入で失敗」という持病を抱える問題に効く特効薬です。