ClawGym:Agent の訓練・評価一体化オープンソースフレームワーク
人民大学が Claw Agent のデータ+訓練+評価を一気通貫でつなぐフレームワークをオープンソース化。13.5K の実行可能タスクを含み、サンドボックス並列強化学習をサポート


ClawGym:Agent の訓練・評価一体化オープンソースフレームワーク
人民大学が Claw Agent のデータ+訓練+評価を一気通貫でつなぐフレームワークをオープンソース化。13.5K の実行可能タスクを含み、サンドボックス並列強化学習をサポート
大規模モデルは「質問に答える」から「タスクを完遂する」へと移りつつありますが、Personal Agent(OpenClaw のようなデスクトップエージェント)向けのデータ構築、モデル訓練、能力評価については、体系的なソリューションがずっと欠けていました。中国人民大学と至知研究院がオープンソース化した ClawGym は、データ合成から訓練、評価までの完全なループを提供する、現時点で最も包括的な OpenClaw 訓練・評価リソースです。
ClawGym とは
ClawGym は Claw Agents 向けの一体化フレームワークで、データ合成、モデル訓練、信頼できる評価を体系的につなぎます。3つのコアモジュールで構成されます。
- ClawGym-SynData:初の Claw Agents 向け大規模合成データセット。13.5K の実行可能タスクを含む
- ClawGym-Agents:OpenClaw のブラックボックス実行軌跡に基づいて Agent を訓練し、サンドボックス並列強化学習を探索
- ClawGym-Bench:200個の高品質タスクからなる評価ベンチマーク。6種類のワークスペースシーンをカバー

- GitHub:https://github.com/ClawGym
なぜ専門の Agent フレームワークが必要なのか
Claw-style 環境は、従来のテキスト Q&A、ウェブ閲覧、単純なツール呼び出しとは本質的に異なります。Agent が直面するのは静的な問題ではなく、ファイル、ディレクトリ、スクリプト、表、設定、ログ、外部ツールで構成される複雑なワークスペースです。
複数回のやり取りの中でファイルを読み、コマンドを実行し、データを分析し、ドキュメントを修正し、レポートを生成し、環境からのフィードバックに基づいて行動を絶えず調整する必要があります。1つ1つの操作がワークスペースの状態を変え、その後の意思決定はこれらの中間状態に依存します。
タスクが完了したかどうかは、Agent が「完了しました」と言うかではなく、最終的なワークスペースが実際に正しく更新されたかどうかで決まります。
これにより、4つの核心的な課題が生まれます。
- タスクの構築が難しい:実際のワークフローと実行可能な操作をカバーする必要があり、単に prompt を1つ生成するだけでは済まない
- 軌跡の収集が難しい:ブラックボックスの実行ログから高品質な訓練軌跡を復元する必要がある
- 訓練の安定化が難しい:強化学習段階では大量の独立したサンドボックスで並列に rollout する必要がある
- 報酬の定義が難しい:ファイル、構造、数値、多次元の成果物の品質を検証する必要がある
ClawGym-SynData:13.5K の実行可能タスク
2つのルートによるタスク合成
タスクが実際のニーズに近く、かつ本当に実行可能であることを保証するため、ClawGym は2つの互いに補完する合成ルートを使っています。
- Persona-driven のトップダウン:「ユーザーが何をしたいか」から出発し、ユーザーペルソナ、作業シーン、原子操作の組み合わせを構築して、実際のオフィスシーンに近いタスクを生成
- Skill-grounded のボトムアップ:「システムに何ができるか」から出発し、OpenClaw skills から再利用可能なツール能力を抽出して、タスクが実行可能な操作に着地することを保証
Mock Workspace の自動生成
各タスクには自動生成された軽量な mock workspace(Markdown、JSON、CSV、YAML、設定ファイルなど)があり、実行過程で読み取り、分析、修正する必要のある内容を提供します。
ハイブリッド検証メカニズム
- Code-based verification:ファイルパス、スキーマ、数値計算、フィルタリングルールなどの客観的正しさを検査
- Rubric-based verification:レポートの明瞭さ、要約の忠実度、表現の専門性などの主観的品質を評価
ClawGym-Agents:実際の軌跡からの訓練
ClawGym は OpenClaw のブラックボックス rollout を通じて実際の対話軌跡を収集し、簡略化した agent loop を再実装することはしません。軌跡は集約・クレンジング・選別を経た後、平均して次を含みます。
- 13.00 ラウンドの対話
- 18.67K tokens
- 15.82 回のツール呼び出し
- 3.25 種類のツールタイプ
これらの軌跡に基づいて Qwen3 シリーズモデルに multi-turn SFT を行い、3つのモデルを得ました。
| モデル | ベース | 特徴 |
|---|---|---|
| ClawGym-4B | Qwen3-4B | 軽量級 |
| ClawGym-8B | Qwen3-8B | バランス型 |
| ClawGym-30B-A3B | Qwen3-30B-A3B | 高性能 |
さらにサンドボックス並列 RL も探索しています。各タスクは独立した sandbox で実行され、code verifier が outcome reward を提供します。実験では、RL が SFT の上にさらなる向上をもたらすことが示されました。
ClawGym-Bench:200 個の厳選評価タスク
ClawGym-Bench は厳格な選別を経た200個のタスクを含み、6種類の典型的なワークスペースシーンをカバーします。
- 生産性とコラボレーション
- システムと自動化
- 分析と推論
- コンテンツと領域サポート
- 計画とナレッジ管理
- ソフトウェア開発
各タスクは「大規模モデルによる診断的チェック+人間によるレビュー」という二重審査を経ており、指示の明確さ、リソースの完全性、検証の信頼性が保証されています。
実験結果
主要なデータ:
- ClawGym-4B、8B、30B-A3B は ClawGym-Bench でそれぞれ 47.73、50.24、56.82 に達し、いずれも対応するベースモデルを上回った
- ClawGym-30B-A3B はより大規模な Qwen3-235B-A23B を超えた。高品質な Agent データがモデル規模の不足を補えることを示す
- ClawGym-SynData のみで訓練しても、外部ベンチマーク PinchBench で明確な向上を達成(ClawGym-30B-A3B は 86.00 に到達)。学んだのはタスクのテンプレートではなく、移転可能な実行能力であることを証明する
オープンソース化済みリソース
チームは5つのコアリソースをすでにオープンソース化しています。
- ClawGym-Bench 評価データ
- 評価コード
- ClawGym-Agents モデルチェックポイント
- 訓練データ
- 訓練コード
GitHub:https://github.com/ClawGym
適したシーン
- Agent 研究者:完全な訓練データと評価ベンチマークを提供
- モデル開発者:ClawGym-SynData をそのまま multi-turn SFT と RL に使える
- Agent プロダクトチーム:ClawGym-Bench で異なるモデルの実際の実行能力を評価
- オープンソースコミュニティ:ClawGym フレームワークをベースに、より多くのタスクタイプと評価次元へ拡張
ClawGym の核心的価値は、モデルが「答えを言えるか」だけを見るのではなく、モデルがワークスペースの中で検査可能で検証可能なタスクを完遂できるかを体系的に見ている点にあります。Personal Agent にとって、これは対話能力から実行能力へ進む重要な一歩です。