Codex 上級テクニック:AI Agent に終日働いてもらう

·Toolin 編集部

OpenAI Codex チームメンバーが完全なワークフローを公開。長期スレッド管理、Heartbeats による定時タスク、Goal モード、ローカルナレッジベース構築までを網羅し、Codex をツールから常勤の AI 社員へと変えます。

Codex 上級テクニック:AI Agent に終日働いてもらう

OpenAI Codex の週間アクティブユーザーは2026年4月に400万人を突破しましたが、大多数の人はまだ「一度聞いて一度答える」使い方にとどまっています。Codex チームの Jason Liu(オープンソースライブラリ Instructor の作者、13k Star)が自分の完全なワークフローを公開しました。その核心となる発想は、Codex を長期間動き続け、継続的にタスクを引き受ける仕事システムへと作り変えることです。本記事ではこの方法を再現可能な操作ステップに分解して解説します。

Codex チームメンバー Jason Liu の完全なワークフロー共有

始める前の準備

  • OpenAI アカウントと、Codex へのアクセス権限
  • Codex の対話画面操作の基本的な理解
  • (任意)Obsidian をローカルのナレッジベース管理ツールとして使う
  • 想定セットアップ時間:30分

ステップ1:長期生存する専用スレッドを作る

多くの人は一問一答でセッションを閉じがちですが、Jason のやり方は、数か月単位で生き続ける巨大なスレッドをいくつも開いたままにし、むやみに終了しないことです。

具体的な操作:

  1. ワークフローごとに独立したピン留めスレッドを作る(スケジュール管理、オープンソースプロジェクトの保守、SNS の監視など)
  2. Command-1 から Command-9 のショートカットで、ワンタッチで別スレッドへジャンプ
  3. スレッドに対話履歴・好み・意思決定を蓄積させ続けることで、次に使うときに背景を改めて説明する必要がない

ワークフローごとのピン留めスレッドとショートカットでの切り替え

ヒント: スレッドのライフサイクルが長くなると、プロジェクトの背景、コミュニケーションの癖、過去の意思決定が自然に蓄積され、Agent に連続性が備わり始めます。

ステップ2:音声でタスクを出し、元の思考をそのまま残す

Jason がタスクを出すときはタイピングではなく、主に話しています。理由はシンプルで、口に出すほうが元の思考を完全に残せ、Prompt を意識的に磨く必要がなく、曖昧で飛び散ったアイデアをそのまま Agent に投げられるからです。

さらに Codex の Steering 機能と組み合わせれば、Agent がタスクを実行している最中に割り込んで指示を追加でき、言い終わったらそのまま立ち去れて、じっと待つ必要もありません。

ステップ3:Heartbeats で定時タスクのスケジューリングを実現

ここが、Codex をツールから社員へ変える要点です。Heartbeats は Agent に定時タスクスケジューリングの層を追加するようなもので、@computer の操作能力と組み合わせれば、完全自動のループ実行が実現できます。

Heartbeats + @computer の組み合わせ技

実際の事例:

  • Chief of Staff スレッド:30分ごとに一度走り、Slack と Gmail を一通りスキャンして優先度を判断し、返信ドラフトを作るが送信はしない。最終的な判断は人が下す
  • アニメレビューのフロー:まず動画を Slack のレビュースレッドに投稿し、Codex に15分ごとにチェックさせる。同僚がフィードバックを出せば、自動で再レンダリングしてスレッドに返信
  • カスタマーサポートの順番待ち追跡:シャワーの前に Codex に Amazon カスタマーサポートの順番待ち状況を見張らせ、シャワーから出たころには返金が着金していた

同様のフローは Google Docs のコメントや GitHub PR Review などのシーンにも拡張でき、フィードバックさえあれば次のステップを自動で進められます。

Slack、Gmail、GitHub などをカバーする自動化ワークフロー

ステップ4:検証メカニズムを設ける

Jason が最も強調するのは検証メカニズムで、タスクをいつ終了させるかを判断するために使います。彼は Codex に Python の Rich ライブラリを Rust へ完全移植させたことがありますが、ハード要件は「元の Python ライブラリのすべてのユニットテストに通ること」でした。

テストに通るかどうかがタスク完了の判定となり、失敗すれば Agent は修正を続けます。

検証メカニズムのない野心は、せいぜい願望でしかありません。

ステップ5:Goal モードで長期タスクを処理する

最新のアップデートで、OpenAI は Goal モードを実験版から正式版へ昇格させました。最終ゴールと受け入れ基準さえ明確にすれば、Codex が自律的に前進を続け、短ければ数時間、長ければ数日。途中で進捗を確認したり方向を調整したり、そのまま一時停止することもできます。

前提として、タスク自体に明確で検証可能なフィードバックループが存在しなければなりません。

ステップ6:ローカルナレッジベースを築き、記憶を自分の手に

Jason のすべての長期スレッドは Obsidian vault から始まり、ディレクトリは TODO、people、projects、agent、notes などのセクションに分かれています。

トップレベルの AGENTS.md にルールを書いておきます:メンバー情報の更新、プロジェクトの進捗、TODO の完了などの変更があれば、ナレッジベースの該当内容も同期して更新する、と。

こうするメリットは:

  • 中核となる記憶データをローカルの管理可能なファイルに置き、いつでも閲覧し手動で修正できる
  • バージョン差分で変更を確認でき、問題が起きればワンタッチでロールバック
  • ツールを変えたりプラットフォームを移行するときも、ナレッジベースを持ってすぐ移れる

Codex サイドバーの新機能

Codex のサイドバーはチャット対話に限らず、Markdown を直接レンダリングし、テーブルを絞り込み、PDF や PPT を閲覧できます。Agent は内蔵ブラウザ経由で JavaScript でページを操作することもでき、見ながら注釈を付けられて、ウィンドウを行き来する必要がありません。

Codex サイドバーのアップグレード、Markdown レンダリングとファイルプレビューに対応

よくある質問

  • Heartbeats はどれくらい Token を消費しますか? チェック頻度とタスクの複雑さによります。まずは30分ごとから試すのがおすすめです
  • 画面ロック中でも Codex は仕事を続けられますか? はい、最新アップデートでロック中のリモート作業に対応し、スマホからリアルタイムで確認・承認、さらにはタスクの引き継ぎも可能です
  • Goal モードはどんなタスクに向いていますか? 「すべてのユニットテストに通る」「XX 仕様に準拠したコードを生成する」のように、明確な受け入れ基準のあるタスクが必要です