OpenAI公式の実践:Skillsでオープンソース保守を加速、PRマージ数45%増

·Toolin 編集部

OpenAIチームがCodex SkillsでAgents SDKの保守プロセスを改良。AGENTS.md、ローカルスキル、GitHub Actionsにより、3ヶ月間のPRマージ数が316から457に増加、45%の向上

OpenAI公式の実践:Skillsでオープンソース保守を加速、PRマージ数45%増

OpenAIチームはCodexを使ってAgents SDKリポジトリの保守方法を改良しました。リポジトリローカルのSkills、AGENTS.mdファイル、GitHub Actionsによって、繰り返し発生するエンジニアリング作業を再実行可能なワークフローに変えています。

効果は顕著です:2025年12月1日から2026年2月28日までの間、2つのリポジトリで合計457件のPRがマージされました。一方、その前の3ヶ月(2025年9月1日から11月30日)は316件にとどまっており、45%の向上です。

  • Pythonリポジトリ:182 → 226件のPR
  • TypeScriptリポジトリ:134 → 231件のPR

この構成はかなりシンプルですが、効果は明白です。オープンソースプロジェクトを保守しているなら、この方法は参考になるはずです。

背景:高アクティビティのSDKリポジトリ

OpenAI Agents SDKはPython版とTypeScript版の2種類を提供し、エージェントアプリケーション構築のコアコンポーネントを提供するとともに、Realtime APIの上に音声エージェントを構築する簡潔なソリューションでもあります。

利用規模:

  • Pythonパッケージ(PyPI):直近30日で約1470万ダウンロード
  • TypeScriptパッケージ(npm):直近30日で約150万ダウンロード

このアクティビティは、大量のPR、Issue、保守作業を意味します。従来のやり方では、繰り返しのエンジニアリング作業が多くの時間を消耗させます。

Skillsシステムの4層アーキテクチャ

コア構成:4層アーキテクチャ

システム全体は非常に簡潔です:

  1. ポリシー層:リポジトリのポリシーはAGENTS.mdに書く
  2. スキル層:リポジトリローカルのスキルは.agents/skills/ディレクトリに置く
  3. スクリプト層:スキル内部にはスクリプトと参考資料を含められる
  4. CI層:同じワークフローをCIで実行する必要があるときは、Codex GitHub Actionを使う

この構成により、Codexはリポジトリの動作方式について安定したコンテキストを持ち、繰り返しのエンジニアリング作業がより速く、より正確になります。

Skillsのプログレッシブディスクロージャーモデル

スキルはプログレッシブディスクロージャー(progressive disclosure)モデルを採用しています:

  1. まずnameやdescriptionなどのメタデータだけが見える
  2. 選択されたときに初めてSKILL.mdの全文がロードされる
  3. 必要なときに初めて参考資料を読んだりスクリプトを実行したりする

これにより、最初からエージェントのコンテキストを膨らませることなく、豊富な指示、スクリプト、参考資料を携えられます。

スキルのプログレッシブディスクロージャーモデル

Pythonリポジトリ:8つのコアSkills

Pythonリポジトリはより簡潔なベースバージョンで、8つのスキルを含みます:

1. code-change-verification コードやビルドの挙動が変わったときに、必要なフォーマット、lint、型チェック、テストのフローを実行します。

2. docs-sync コードベースと照らし合わせてドキュメントを監査し、欠落、誤り、古くなったドキュメントを見つけます。ソースコード内のdocstringとコメントを、リファレンスドキュメント生成の権威あるソースとして扱います。

3. examples-auto-run 自動モードでサンプルを実行し、ログとリトライ用の補助ファイルを生成します。

4. final-release-review 前回のリリースタグと現在のリリース候補バージョンを比較し、リリース準備状況をチェックします。

5. implementation-strategy ランタイムの変更やAPI変更の前に、互換性の境界と実装方針を先に確定します。

6. openai-knowledge 公式Docs MCPワークフローを通じて、最新のOpenAI APIとプラットフォームドキュメントを取得します。

7. pr-draft-summary 引き継ぎの際に、ブランチ名の候補、PRタイトル、ドラフト説明を準備します。

8. test-coverage-improver カバレッジチェックを実行し、最大のギャップを見つけ、インパクトの大きいテスト提案を行います。

JavaScriptリポジトリ:追加の3つの専用Skills

JavaScriptリポジトリは同じ全体パターンに従いつつ、npm monorepoとリリースプロセスに合わせて、リポジトリ固有の3つのスキルを追加しています:

1. changeset-validation チェンジセットとバージョンアップグレードレベルが、パッケージの差分に本当に一致しているかをチェックします。

2. integration-tests パッケージをローカルのVerdaccio(ローカルnpmパッケージレジストリ)レジストリに公開し、サポート対象の各ランタイムでのインストールと実行の挙動を検証します。

3. pnpm-upgrade pnpmツールチェーンとCI内のバージョンロックの更新を調整します。

重要な設計原則

1. 責務が明確な契約 各スキルには明確なトリガー条件と具体的な出力があります。

2. 「まず報告、それから行動」のワークフロー docs-syncとtest-coverage-improverは「まず報告、それから行動」のワークフローです。現在の差分やカバレッジ成果物をチェックして優先順位をつけ、編集の前に承認を求めます。

3. 狭い範囲の専用スキル JavaScript専用のpnpm-upgradeスキルは範囲が狭く、pnpmバージョン更新の調整だけを担当し、それ以外のことはしません。

4. ワークフローはリポジトリに置く これらのワークフローを、どこかのドキュメントやWikiに隠すのではなく、コードのそばに置きます。

  • Pythonリポジトリ:.agents/skills/
  • JavaScriptリポジトリ:.agents/skills/

実践例:PRレビューフロー

PRレビューを例にすると、従来のフローでは:

  1. コードフォーマットを手動でチェック
  2. lintと型チェックを実行
  3. テストスイートを実行
  4. ドキュメントが更新されているか確認
  5. テストカバレッジを確認
  6. PR説明を準備

今ではCodexがこうできます:

  1. code-change-verificationスキルを呼び出して自動検証
  2. docs-syncスキルを呼び出してドキュメントをチェック
  3. test-coverage-improverスキルを呼び出してカバレッジを分析
  4. pr-draft-summaryスキルを呼び出してPR説明を生成

フロー全体が自動化され、保守者は結果をレビューするだけです。

始め方は?

1. Codex for Open Sourceに申請する 条件を満たすオープンソースプロジェクトの保守者は申請できます:

  • Codex付きChatGPT Pro
  • APIクレジット
  • Codex Securityの条件付きアクセス権

申請先:https://openai.com/codex-for-open-source

2. AGENTS.mdを作成する リポジトリのルートにAGENTS.mdを作成し、リポジトリのポリシーとワークフローの説明を書き込みます。

3. .agents/skills/ディレクトリを作成する リポジトリ内に.agents/skills/ディレクトリを作成し、スキルごとにサブディレクトリを1つ用意します。

4. スキルマニフェストを書く 各スキルには以下を含めます:

  • SKILL.md:マニフェストファイル。スキルの責務、トリガー条件、出力を記述
  • scripts/:任意のスクリプトディレクトリ
  • references/:任意の参考資料ディレクトリ
  • assets/:任意のアセットディレクトリ

5. GitHub Actionsを設定する Codex GitHub Actionを使ってCI上でスキルを実行します。

Toolinのレビュー

こんな人・チームに向いている?

  • 高アクティビティのオープンソースプロジェクトを保守するチーム
  • 大量の繰り返しエンジニアリング作業があるプロジェクト
  • 標準化されたPRレビューフローが必要なプロジェクト

コアな強み:

  • 構成はシンプルなのに効果は明白(PRマージ数45%増)
  • プログレッシブディスクロージャーモデルで、コンテキストを膨らませない
  • ワークフローがリポジトリに残るので、保守と引き継ぎが容易
  • 同じスキル一式をローカルとCIの両方で再利用できる

制約:

  • Codex for Open Sourceの資格申請が必要
  • 初期にスキルマニフェスト作成の時間投資が必要
  • 小規模プロジェクトには過剰エンジニアリングになり得る

まとめ: 保守しているオープンソースプロジェクトに大量の繰り返しエンジニアリング作業があるなら、この方法は試す価値があります。OpenAIチームが実際のデータで効果を証明しました:3ヶ月でPRマージ数45%増、しかも構成はかなりシンプルです。

鍵となるのは、ワークフローをリポジトリに「固定化」し、AIが安定して依存できるコンテキストを持たせることです。

関連記事

Baidu DuMate 実践ガイド:インストールからオフィス自動化まで
AIチュートリアル

Baidu DuMate 実践ガイド:インストールからオフィス自動化まで

中国製の汎用オフィスエージェントDuMateの全プロセスチュートリアル。インストール、スキル、アプリ接続、自動化をカバーし、3分で使い始めて日常のオフィス業務をAIに任せる。

Toolin 編集部
DeNovoSWE:初の長期Doc2Repo訓練セット、Code Agentにリポジトリ構築を学ばせる
AI製品

DeNovoSWE:初の長期Doc2Repo訓練セット、Code Agentにリポジトリ構築を学ばせる

中国人民大学高瓴学院がDeNovoSWEデータセットを公開。4818件の実タスクインスタンスでCode Agentにドキュメントからの完全なリポジトリ生成を学ばせ、Qwen3-30BはBeyondSWE-Doc2Repoで5.8%から47.2%へ向上。

Toolin 編集部
Doubao Seed 2.1 Pro 実測:Codingがトップティア入り、マルチモーダルにも驚き
AI製品

Doubao Seed 2.1 Pro 実測:Codingがトップティア入り、マルチモーダルにも驚き

ByteDanceのDoubao Seed 2.1 Proを実測。Agent Codingとマルチモーダル能力が本番利用可能な水準を超え、スクリーンショットからのフロントエンド対話復元に対応。価格はClaude Opus 4.6比で約80%低下。

Toolin 編集部
Hyper3D Rodin Gen-2.5:4秒で100万ポリゴン、3D生成にThinking機構を導入
AI製品

Hyper3D Rodin Gen-2.5:4秒で100万ポリゴン、3D生成にThinking機構を導入

影眸科技(Deemos)がHyper3D Rodin Gen-2.5を発表。3D生成で初めてLLM類似のThinking機構を導入し、4秒で100万ポリゴンのモデルを生成、1000万ポリゴン精度と12Kネイティブテクスチャを実現した。

Toolin 編集部
WeChat「小微」AIアシスタント実測:12の入口がチャット・コンテンツ・ドキュメントの全シーンをカバー
AI製品

WeChat「小微」AIアシスタント実測:12の入口がチャット・コンテンツ・ドキュメントの全シーンをカバー

WeChatネイティブのAIアシスタント「小微」は段階的ロールアウト中。メインモデルは自社開発のWeLMで、チャット履歴の検索、公式アカウント記事の要約、ローカル生活サービスの呼び出しが可能。機密性の高い操作には二段階確認が必要。

Toolin 編集部
DeNovoSWE:初の長距離Doc2Repo訓練セット、Code Agentにリポジトリ構築を学ばせる
AI製品

DeNovoSWE:初の長距離Doc2Repo訓練セット、Code Agentにリポジトリ構築を学ばせる

中国人民大学高瓴学院がDeNovoSWEを発表。「ドキュメントから完全なリポジトリを生成する」初の長距離訓練セットで、4818件の実タスクインスタンスを含む。Qwen3-30BはBeyondSWE-Doc2Repoで5.8%から47.2%へ向上した。

Toolin 編集部