Arborをオープンソース公開:Agentに盲目的な試行錯誤ではなく、研究者のような科学研究をさせる

·Toolin 編集部

中国人民大学高瓴人工知能学院 × Microsoft Research が自律科学研究フレームワークArborをオープンソース化。Hypothesis-Treeで複数回の実験を蓄積可能な研究状態へと組織し、HuggingFaceデイリーランキング首位を獲得。長期タスクのheld-outゲインはCodex・Claude Codeの平均の2.5倍超。

Arborをオープンソース公開:Agentに盲目的な試行錯誤ではなく、研究者のような科学研究をさせる

今のAIエージェントはコードを書き、実験を走らせ、方針を直せる。しかし大多数はひとつの中核的な敷居を越えられない:実行はできても、自律的な科学研究ができない。ある方向を試して失敗し、別の方向を試してまた失敗し、たまに成功しても、その成功の背後にあるメカニズムを知見として沈殿させられない。中国人民大学高瓴人工知能学院 × Microsoft Research の研究者たちは Arbor をオープンソース化した——汎用かつ実用的な自律科学研究フレームワーク&ツールキットで、「仮説ツリー(Hypothesis-Tree)」によって短命な実験の数々を、長期的に蓄積でき監査可能な研究状態へと組織する。論文はHuggingFace Daily Paperの日別ランキング1位に立った。

この記事では、Arborが解決する問題、中核メカニズム、実測効果、始め方を順に分解する。

何を解決するのか

論文は自律科学研究を Autonomous Optimization(AO) として形式化する:初期artifact(モデル学習コード、agent harness、データ生成pipeline)+研究目標+実行可能なevaluatorを与えられ、Agentは段階ごとの人的監督なしに、devセットだけを見て、複数ラウンドの実験を通じてartifactを改良し続け、最終的にtestセットで効果を向上させる。

既存のAgentは3つの点で立ち往生している:

  • 対話履歴が長くて散らかっており、構造化された研究判断を担えない
  • 作業ディレクトリはコードの変化しか記録せず、その変化に対応する仮説を説明しない
  • ログは結果を保存しているが、Agentになぜ成功・失敗したかを教えられない

その結果、Agentは多くのtrialを走らせても、それらのtrialが本当のresearch progressへ収束しない。

上図はあるMath-Reasoning Data Synthesis実行で得られた仮説ツリーと、対応するdevelopmentスコア曲線だ。

中核メカニズム:Hypothesis-Tree+insightの伝播

Arborの鍵は、Agentに何度も試させることではなく、探索の組織の仕方を変えることにある。

Hypothesis-Tree(仮説ツリー)

研究空間を木構造へ構造化し、各ノードを検証待ちの仮説とする。Agentは仮説を軸に隔離実行、エビデンス比較、探索木の更新を行い、一本の軌跡上で突き進み続けるのではない。

insight伝播メカニズム

最も中核的なコンポーネント。失敗は捨てられる負例ではなく、帰因・抽象・伝播される研究エビデンスであり、成功も孤立したスコア向上ではなく、再利用可能な局所的発見である。これらのinsightは木に沿って上方へ伝播し、以降の探索分布を形成し続ける——Agentは失敗済みの経路を繰り返すことが減り、有効なメカニズムの周りで掘り下げやすくなる。

Arbor フレームワーク概要

Arborは2つの設計ポイントを強調する:

  • 汎用性:特定のbenchmarkやタスク形態に縛られない。最適化すべきartifact、明確な目標、実行可能なフィードバック信号があれば、model / harness / data のどれでも最適化できる。
  • 実用性:独立CLIとAgent SDKをオープンソース化しており、直接組み込める。

実測効果

6つの実AOタスク(数学推論データ合成、SWE、Terminal-Benchなど)とMLE-Bench Liteにおいて:

  • 6タスクで CodexとClaude Codeの平均に対し相対held-out gain 2.5倍超 の向上を獲得
  • Terminal-Bench 2.0:held-out pass rate を初期69.81から 77.36 へ向上
  • MLE-Bench Lite:Arbor with GPT-5.5 が 86.36% Any Medal を達成、現在のSOTA

消融実験もinsight伝播の重要性をさらに裏付けた(MLE-Bench Lite上):

構成Any Medal
完全なArbor81.82%
仮説ツリーを除去63.64%
ツリーを保持し、insightの上方伝播のみ除去54.54%

直感に反する結論がひとつ:洞察の伝播だけを除くと、木全体を取り除くよりも落ち込む。経験を伝播しない木は実験を「順番に並ばせる」ことしかできず、その後の意思決定に本当に必要な意味的記憶を与えられない。

💡 ヒント:Arborのトークン消費はClaude Codeなどのベースラインと同水準でありながら、より大きいheld-outゲインを手にしている。これはボトルネックが計算量の多寡ではなく、計算がどう組織されるかにあることを示す。

始め方

Arborは独立CLIとAgent SDKを提供する。最適化すべきartifact、実行可能なevaluator、明確な目標があれば、接続して自律最適化を走らせられる。

誰に向くか

  • AI研究者:Arborを長距離自律実験の実行基盤とし、複数回の試行錯誤を再利用可能な研究メモリへ沈殿させる。
  • モデル/Agentチーム:学習コード、agent harness、データpipelineの最適化に使い、素のcoding agentを走らせるより安定したheld-out向上を得られる。
  • 長期タスク開発者:「ひとつの研究対象を継続的に最適化する」必要のあるシーンはすべて、ArborのAO定義に収まる。

現時点の限界

著者たちは率直に認める:Arborは、Agentが人間研究者級の創造性を備えたことを意味しない。現状のAgentが生成するideaの品質にはまだ大きな改善余地があり、困難なタスクでは真に新規なメカニズムを提起できなかったり、有望な方向を早々に手放したりするおそれがある。より高品質な仮説の生成、真の向上と偶然の過剰適合の区別、より長い周期での信頼できる記憶の維持は、いずれもopen questionだ。

参考