PawBench:オープンソースのAgent評価ベンチマーク、4050のテストユニットでモデルとフレームワーク選びを支援

·Toolin 編集部

PawBench v1.0は150タスク・4050テストユニットのAgent評価セットを構築し、ベースモデルと実行フレームワークを同一の体系に収めて、モデル+Harnessの最適な組み合わせを見つける手助けをします。

PawBench:オープンソースのAgent評価ベンチマーク、4050のテストユニットでモデルとフレームワーク選びを支援

Agentタスクが失敗したとき、それはモデルが「ちゃんと考え切れていない」のか、それともツールと環境が「正しく設定されていない」のか。この問いに答えるのはこれまで常に難しいものでした。PawBench v1.0は、ベースモデルと実行フレームワーク(Harness)を同じ評価体系に載せ、最適な組み合わせを見つける手助けをします。

PawBenchとは

PawBenchは、パーソナルアシスタントおよび汎用エージェントのシーン向けオープンソース評価ベンチマークです。単なるモデルランキングを作るのではなく、「モデル + Harness + タスク」の3つを組み合わせてクロス評価を行います。

評価マトリクス:9モデル x 3 Harness x 150タスク = 4,050テストユニット

3つのHarnessはそれぞれHermes、OpenClaw、QwenPawです。すべてのタスクはDockerサンドボックスで実行され、実行トレースと環境スナップショットが保存されます。

PawBenchの評価アーキテクチャ

150タスクの5次元ラベル体系

各問題は5つの次元でラベル付けされます:

  1. 応用シーン:オフィス協働、ソフトウェアエンジニアリング、自動化スクリプト、マルチモーダルコンテンツ生成
  2. 原子能力:ツール呼び出し、Skill利用、プランニング、論理推論、自己検証
  3. 複雑度:L1 / L2 / L3
  4. 入力モダリティ:純テキスト vs マルチモーダル
  5. 実行環境:オフラインサンドボックス vs ネット接続必須

主要な発見

発見1:Harnessはモデルのパフォーマンスを左右する

同じモデルでHarnessだけを入れ替えると、スコア差は最大11.5ポイントに達します。最も典型的な例がqwen3.6-35b-a3bで、QwenPaw環境では70.4点を獲得した一方、Hermesでは68.2点にとどまりました。

原因としては以下が挙げられます:

  • 成果物レベルのハード検証の欠如:Harnessはモデルが「完了した」と言うのを聞き入れるだけで、ファイルが本当に存在するかをチェックしない
  • パス認識の不足:現在の作業ディレクトリがどこかをモデルに伝えず、モデルが誤った位置に書き込んでしまう
  • ツール数の過負荷:Hermesは約65ツール、OpenClawは約30ツール、QwenPawは約15ツール。ツールが多すぎるとコンテキストを圧迫し、意思決定の負担が増す

発見2:Skillの能動的発見が弱点

3つのHarnessはいずれも17のSkillタスクで振るいませんでした。核心的な問題は、Harnessがワークスペース内のSkillファイルを能動的にスキャンせず、グローバルにプリインストールされたスキルリストにのみ依存していることです。

発見3:Web検索はデフォルトの利用可能性に依存

Hermesの検索ツールはAPI Keyを設定しないと有効化できず、ゼロ設定では「施錠された」状態になります。一方、OpenClawは認証不要のDuckDuckGo検索に対応し、ゼロ設定で直接利用できます。

Harness設計の4原則

評価結果に基づき、PawBenchはそのまま使える4つの設計原則を示しています:

原則ポイント
Inform Fully実行環境をモデルに明確に伝える:cwd、workspace、出力ディレクトリ、利用可能なリソース
Equip on Demand重要なツールをデフォルトで利用可能にし、ツール数をモデルのアテンション予算に合わせる
Monitor Actively成果物が本当に存在するかを確認し、モデルの「完了した」を鵜呑みにしない
Recover Gracefully異常を検出したら現在の状態を注入し、何が不足しているかを説明して、一度軌道修正の機会を与える

誰に向いているか

  • Agentユーザー:より適したモデルとHarnessの組み合わせ選びを支援
  • Harness開発者:4050セルの対照マトリクス+スライス分析機能で、横断的な自己検証、失敗プロファイリング、回帰検証を支援
  • 研究者:5次元ラベル体系に基づいて異なる次元のAgent能力を分析

入手方法

プロジェクトはオープンソース化されており、GitHubでagentscope-ai/PawBenchと検索すれば見つかります。新しいHarnessの接続、新しいモデルの評価結果の提出、新しいタスクの貢献を受け付けています。

関連記事

Xiaomi MiMo UltraSpeed:1兆パラメータモデルで1000 tokens/sをたたき出す
AI製品

Xiaomi MiMo UltraSpeed:1兆パラメータモデルで1000 tokens/sをたたき出す

XiaomiのMiMo-V2.5-Pro UltraSpeedは、汎用8基GPU構成で1兆パラメータモデルの1000 tokens/s出力を実現。知能を絞ったFlash版ではなくProフルスペック版で、APIはすでに公開され体験申請が可能です。

Toolin 編集部
Tabbit:永久無料のAIブラウザ、10以上のトップモデルが使い放題
AI製品

Tabbit:永久無料のAIブラウザ、10以上のトップモデルが使い放題

美团(Meituan)がリリースしたAIブラウザTabbit V1.0は、コア機能が永久無料。国内トップクラスの大規模モデル10以上とAgent能力を内蔵し、300以上の妙招(スキル)をワンクリックで呼び出せます。

Toolin 編集部
AI社員に海外インフルエンサー探しを任せる:AhaCreator実践ガイド
AIチュートリアル

AI社員に海外インフルエンサー探しを任せる:AhaCreator実践ガイド

AhaCreatorでインフルエンサー選定、コンテンツ審査から海外送金まで、海外インフルエンサーマーケティングの全工程をこなす方法を丁寧に解説します。個人開発者と海外展開チームに向いています。

Toolin 編集部
AI長尺動画生成:2つのオープンソースフレームワーク比較レビュー
AI製品

AI長尺動画生成:2つのオープンソースフレームワーク比較レビュー

同日に発表された2大オープンソースフレームワーク、VideoClawとJoyAI-Echo。マルチエージェント協調とクロスモーダル記憶ライブラリという異なるアプローチでAI長尺動画の一貫性問題に挑む両者の技術方案を比較します。

Toolin 編集部
ChatGPTの記憶システムが全面刷新:Dreaming V3登場
AI製品

ChatGPTの記憶システムが全面刷新:Dreaming V3登場

OpenAIが全新のDreaming V3記憶アーキテクチャを発表。ChatGPTが裏で「夢を見て」あなたの情報を整理し、初めて10億人の無料ユーザーに開放。Plus/Proは記憶容量が2倍になります。

Toolin 編集部
CloudflareがClaude Managed Agentsに対応:開発者向け実践ガイド
AI製品

CloudflareがClaude Managed Agentsに対応:開発者向け実践ガイド

CloudflareがClaude Managed Agents対応を追加しました。開発者はCloudflareプラットフォーム上でClaudeエージェントを実行し、プライベートシステムに接続して、セキュアなAIエージェントデプロイを実現できます。

Toolin 編集部