Darwin Skill 2.0:AI スキルを自己進化させる

·Toolin 編集部

darwin-skill 2.0 はオープンソースの Skill/Prompt 自動最適化ツール。Microsoft の2本の論文のエッセンスを吸収し、複数評価者による独立レビュー + 人的ゲート機構で、AI スキル文書を80点から90点以上へ引き上げます。

Darwin Skill 2.0:AI スキルを自己進化させる

複数の AI Skill や Prompt をメンテナンスしたことがあれば、人手によるレビューがどれだけ辛いかご存知でしょう。すべての Skill を通読し、問題を見つけ、直したらもう一度読む。人的にはまったく持続不可能です。かといって放置すると、Skill は少しずつ「ドリフト」し、効果はどんどん悪くなっていきます。

darwin-skill 2.0 はオープンソースの Skill 自動最適化ツールです。やっていることはシンプル:Skill に点数をつけ、改善案を出し、直したらまた採点し、スコアが上がらなければロールバック。全体のフローは生物の進化のように、世代を重ねて変異・選択・淘汰を行い、残るのはすべてより強いバージョンです。

1.0 から 2.0 へ:Microsoft の2本の論文が変えたもの

1.0 時代には1か月動かして平均+13.5点、ロールバック0回でした。悪く見えませんが、著者はロールバック0回がアルゴリズムの精度を完全に代表するわけではないと気づきました——採点基準をどれだけ厳しく定めるかで、結果の厳しさもその分だけ決まってしまうのです。

転機は2025年5月22日、Microsoft Research が同日に公開した2本の論文です:

  • SkillLens(arXiv 2605.23899):Skill をどう評価すべきかを研究。核心となる発見——単一の AI に Skill を採点させた場合の正解率はわずか**46.4%**で、コイン投げより悪い。しかし採点基準に3つの重要な次元を加えると、正解率は73.8%まで上がる。
  • SkillOpt(arXiv 2605.23904):Skill をどう最適化すべきかを研究。核心となるアイデア——Skill 文書をニューラルネットワークの「外部の訓練可能な状態」とみなし、誤差逆伝播で最適化する。

2.0 はこの2本の論文のエッセンスを直接吸収し、4つの核心アップグレードを行いました。

2.0 の4つの核心アップグレード

1. 採点基準を8次元から9次元へアップグレード

SkillLens 論文の中で正解率を46.4%から73.8%へ引き上げた「処方箋」をそのまま取り入れています:

  • 失敗モードのコード化:「X が起きたら Y をする。それ以外は Z をする」という明確な分岐を必ず書く。正しいフローだけを書いてはいけない
  • 実行可能な具体性:「提案する」「検討してもよい」「状況による」などの軟化表現を明文で禁止し、3か所以上の出現で減点
  • 高リスク行動のブラックリスト:Skill には独立した「絶対にやってはいけないこと」セクションが必須

2. 複数評価者による独立レビュー

単一の AI 評価者に依存しなくなりました。各ラウンドで2人の独立した評価者(互いの存在を知らない)を起動し、合意スコアだけを有効とします。次のラウンドでは2人のまったく新しい評価者を起動し、アンカリング効果を回避します。

スコアがプラトーに入った場合(1ラウンドの上昇幅 < 1点)、早期停止機構が自動で止まります。

3. Human in the Loop の人的ゲート

ここがダーウィンと SkillOpt の最大の違いです。SkillOpt は benchmark 駆動のフル自動フローで、エンタープライズ級のシーンに向いています。しかし個人開発者にとっては、benchmark 自体の定義が難しい——「自分が読んでスムーズか」という主観的な次元は自動ループに組み込めません。

ダーウィン 2.0 は各段階に明示的な人的介入ポイントを設けています:

  • 第1段階:評価者による採点は自動で実行し、レポートは人が確認して何を変えるか決める
  • 第2段階:最も低い次元を自動で修正し、CHECKPOINT で強制的に一時停止してユーザーの確認を待つ
  • 第3段階:新しい評価者を起動して再評価し、上昇幅が閾値未満なら強制停止

4. 反例ブラックリスト

40回の実戦最適化から得た8つのアンチパターンを新たに追加しました。同じ AI が修正も評価も行う、git reset --hard をロールバック手段にする、点数稼ぎのために冗長を詰め込む、テストを飛ばして直接採点する、1ラウンドで複数の次元を変える、などです。

ダーウィン 2.0 のワークフロー

実測効果

368行の実在する Skill(huashu-gpt-image)でテストしました:

段階スコア変化
ベースライン80.82人の独立評価者の合意
Round 191.5+10.7、失敗モードのみ修正
Round 291.65+0.15、早期停止が発動

重要な発見:「失敗モード」という1次元しか直していないのに、「ワークフロー」の次元が7.5から9.0へ跳ね上がりました——失敗モードは明確な分岐を書くことを求めるため、書き出すとフローが自動的に明瞭になるからです。これを「次元相関クラスタ」と呼びます。

スケール検証

2.0 で Skill ライブラリ全体、合計30個近くの Skill をスキャンしました。それぞれに2ラウンドの独立評価者、9次元採点、validation-gated ロールバックを実行:

  • steve-jobs-perspective:64 -> 94(+30、1ラウンドで完了)
  • huashu-weread-advisor:80+ -> 91.4
  • darwin-skill 自身:86.05 -> 92.7(自己言及的な評価)
  • 複数のコンテンツ系 Skill がすべて90+に到達

平均上昇幅は+15点。各 Skill の最適化には完全な git commit チェーンが残り、遡って確認できます。

一括最適化の戦果

使い方

リポジトリのリンクを Agent に渡して、インストールしてもらいましょう:

この Skill をインストールして:https://github.com/alchaincyf/darwin-skill

その後、Agent に「ダーウィン最適化で XX skill を実行して」と言うだけです。ベースライン評価1回 + 最適化1回の実行には約15-30分かかります。時間の大半は評価者 Agent の返答待ちです。

向いている人

  • 複数の Skill / Prompt をメンテナンスする開発者
  • Prompt の品質にこだわりがあるのに1つずつレビューする時間がないチーム
  • AI ツールの出力をより安定させたい個人クリエイター

関連記事

Doubao Seed 2.1 Pro 実測:Codingがトップティア入り、マルチモーダルにも驚き
AI製品

Doubao Seed 2.1 Pro 実測:Codingがトップティア入り、マルチモーダルにも驚き

ByteDanceのDoubao Seed 2.1 Proを実測。Agent Codingとマルチモーダル能力が本番利用可能な水準を超え、スクリーンショットからのフロントエンド対話復元に対応。価格はClaude Opus 4.6比で約80%低下。

Toolin 編集部
Hyper3D Rodin Gen-2.5:4秒で100万ポリゴン、3D生成にThinking機構を導入
AI製品

Hyper3D Rodin Gen-2.5:4秒で100万ポリゴン、3D生成にThinking機構を導入

影眸科技(Deemos)がHyper3D Rodin Gen-2.5を発表。3D生成で初めてLLM類似のThinking機構を導入し、4秒で100万ポリゴンのモデルを生成、1000万ポリゴン精度と12Kネイティブテクスチャを実現した。

Toolin 編集部
WeChat「小微」AIアシスタント実測:12の入口がチャット・コンテンツ・ドキュメントの全シーンをカバー
AI製品

WeChat「小微」AIアシスタント実測:12の入口がチャット・コンテンツ・ドキュメントの全シーンをカバー

WeChatネイティブのAIアシスタント「小微」は段階的ロールアウト中。メインモデルは自社開発のWeLMで、チャット履歴の検索、公式アカウント記事の要約、ローカル生活サービスの呼び出しが可能。機密性の高い操作には二段階確認が必要。

Toolin 編集部
DeNovoSWE:初の長距離Doc2Repo訓練セット、Code Agentにリポジトリ構築を学ばせる
AI製品

DeNovoSWE:初の長距離Doc2Repo訓練セット、Code Agentにリポジトリ構築を学ばせる

中国人民大学高瓴学院がDeNovoSWEを発表。「ドキュメントから完全なリポジトリを生成する」初の長距離訓練セットで、4818件の実タスクインスタンスを含む。Qwen3-30BはBeyondSWE-Doc2Repoで5.8%から47.2%へ向上した。

Toolin 編集部
Baidu搭子(DuMate)実操作チュートリアル:インストールから自動化までの中国製オフィスAgent
AIチュートリアル

Baidu搭子(DuMate)実操作チュートリアル:インストールから自動化までの中国製オフィスAgent

Baidu搭子DuMateの「要求→承認→実行→納品」チェーンを最初から最後まで走らせるガイド。インストール、UI、オフィスシーンの実践と自動化を1本でまとめた。

Toolin 編集部
Claude Tag:AIを本当の意味でチームの同僚にする
AI製品

Claude Tag:AIを本当の意味でチームの同僚にする

AnthropicがClaude Tagを発表。ClaudeをSlackワークフローに組み込み、共有コンテキスト、持続的メモリ、能動的介入に対応する、チーム協働の新パラダイム。

Toolin 編集部