Toolin.ai

Opus 5「チャレンジループ」プロンプト:AI 自身に発注側を演じさせ、24時間で3Aゲームのプロトタイプを作らせる

公開日 · toolin小编

Matt Shumer の「チャレンジループ(Challenge Loop)」プロンプトは、Opus 5 を「メイン Agent + 制作 Agent + 審査 Agent」のマルチエージェント構造で自走的に反復させ、Three.js + Blender MCP と組み合わせて、たった1人で24時間以内に『Outer Wilds』級のブラウザゲームを再現します。

Opus 5「チャレンジループ」プロンプト:AI 自身に発注側を演じさせ、24時間で3Aゲームのプロトタイプを作らせる

最近 X で話題になった Opus 5 のゲーム開発プロンプトにより、開発者の Anshu はたった 24時間 で、ゼロからブラウザで遊べる宇宙探索ゲーム『The Long Silence』を作り上げました。原作者の Matt Shumer は同じプロンプトを使い、Opus 5 に外部素材を一切使わずに『コール オブ デューティ』級の FPS プロトタイプを生成させています。

このプロンプトの核心は 「チャレンジループ(Challenge Loop)」 と呼ばれる仕組みです——モデルにゲームの作り方を教えるのではなく、「帰らせない審査員」をモデルに取り付けるものです。本稿では、このプロンプトのマルチ Agent 構造、再利用可能な3ステップの流れ、そしてこのパターンを自分の長時間タスクへ移す方法を分解して解説します。

遊べる完成品:『The Long Silence』はオープンソースで、ブラウザから直接プレイできます——longsilence.anshu.dev

「チャレンジループ」とは:3つの Agent が互いに圧力をかける

多くのマルチ Agent ゲーム開発フローは「タスク分割 → 実行」の層で止まります。チャレンジループには独立した審査 Agent が1つ追加されており、構造は次のとおりです:

  • メイン Agent:目標を受け取ると自力でタスクを分解し、子 Agent に指示を出します
  • 制作 Agent(複数):コード、テクスチャ、アニメーション、サウンドを並行して生産します
  • 審査 Agent:生成結果を実在の3Aゲームのリファレンスとブラインドで並べて比較し、画面の水準に達しなければ直接やり直しを命じます

鍵は、審査 Agent が独立していることです。メイン Agent の指揮下にないため、モデルが審査基準をこっそり緩めて自分に甘くすることができません。画面が同ジャンルのゲームに及ばなければ、自動でやり直しになります。

⚠️ 現実の注意:このプロンプトは3Aタイトルを本当に1:1で再現できるわけではありません。位置づけは限界まで圧力をかける手段です——Opus 5 の自律的な計画力と長時間反復能力を引き出し、いつ止めるかはあなた(ユーザー)が決めます。

始める前の準備

  • モデル:Anthropic Claude Opus 5(Claude Code 内で実行)
  • モデリングツール:Claude Code に Blender MCP をインストールし、モデル自身に Blender でモデリングさせる
  • レンダリングフレームワーク:Three.js(ブラウザで60fps 目標)
  • 予算:24時間分のモデルトークン消費は決して安くないため、あらかじめ枠を見積もっておくこと
  • GitHub リポジトリ:Opus 5 が自動でまとめた skill を蓄積するために使用

3ステップの再現フロー

ステップ1:基礎目標だけ渡し、Opus 5 に世界観を自分で決めさせる

最低限のハードな制約だけ与え、あとはモデル自身に決めさせます。例:

Three.js で宇宙探索ゲームを作ってください。プレイヤーはゲーム内を歩き回り、宇宙船を操縦できます。ビジュアルはプラスチックっぽくならないように。ブラウザでなるべく安定して60fps で動くこと。

ゲームの世界観、技術アーキテクチャ、アートスタイル——すべて Opus 5 に自主判断で委ねます。素材面では、Claude Code が Blender MCP を導入済みなら、自力でツールを探してモデリングするため、手動で素材を与える必要がありません。

💡 ヒント:このステップで過剰に制約を課さないこと。Opus 5 の長時間計画能力は伸びしろを必要とし、初期に縛りすぎると反復の余地が狭まります。

ステップ2:「24時間の継続目標」を下し、審査 Agent を起動する

初版が遊べるようになったら、Opus 5 に長い時間窓の目標を与え、ビジュアルの全面的な引き上げを要求します。ここから複数の子 Agent が並行稼働を始めます:

  • 制作 Agent がテクスチャ、ライティング、アニメーションを並行最適化する
  • 審査 Agent はゲームのスクリーンショットを『Starfield』など実在の3A宇宙ゲームと項目ごとに比較する
  • この間、Opus 5 が審査基準をこっそり緩めることは許されない

Anshu は、ここで極限の圧力と併せて Opus 5 に適度な「餌」も与えるべきだと述べています:

君にはこの目標を達成する能力がある——全力を尽くして、諦めないこと。

スマートフォンからいつでも進捗を確認できます。ある惑星のシーンに時間をかけすぎていると気づいたら、手動で優先度を調整し、注意をコア体験へ引き戻します。

ステップ3:手動で仕上げ + 経験を skill として蓄積する

自動ループを停止したあとは:

  1. 別の Claude セッションでレンダリングの問題を修正し、コードを整理し、デプロイを完了させます
  2. Opus 5 に、今回の経験を skill としてまとめさせ、GitHub リポジトリに入れます

Anshu のオープンソースリポジトリによれば、Opus 5 は審査過程で自前の検収ツール一式を作り上げています:17項目の強制チェックフローの内蔵、シーンごとの自動スクリーンショット比較、フレームレート統計、露出データの分析。これはモデルが審査 Agent の圧力を受けて自発的に生み出した副産物で、この検収スクリプト一式は自分のプロジェクトにもそのまま転用できます。

検証結果

完成時の成果物は次を満たすはずです:

  • ブラウザで滑らかに動作する(60fps 目標)
  • すべてのテクスチャ、アニメーション、サウンドが AI 生成で、外部素材なし
  • 内蔵検収ツールの17項目チェックをすべて通過
  • 経験が再利用可能な skill として蓄積済み(GitHub リポジトリ)

longsilence.anshu.dev を開けば、このフローが生んだ完成品の仕上がりを直接体験できます。

転用可能なコアパターン:AI 自身に発注側を演じさせる

チャレンジループの真の価値はゲーム開発そのものではなく、転用可能なマルチ Agent 検証パターンにあります:

メイン Agent(タスク分解)
  ├── 制作 Agent × N(並行して作業)
  └── 審査 Agent(独立・ブラインド・譲らない)
        ↓
   基準達成? 否 → やり直し
        はい → 次のイテレーション

この構造は、客観的なリファレンスが存在するあらゆる長時間タスクに使えます:

  • Web 開発:審査 Agent があなたの完成品と競合のスクリーンショットをブラインド比較する
  • ドキュメント執筆:審査 Agent が業界トップクラスの記事と項目ごとに比較する
  • コードリファクタリング:審査 Agent がテストケースと性能ベンチでハード指標の検収を行う

このパターンの転用可能性はすでにネット上で検証済みです:Ryan Campbell は同じプロンプトでカートレースゲームを反復改善し、Yogi Suria はClaudepunk 2077 を作り上げました。同じ指示を GPT-5.6 Sol に移しても動き、出来は Opus 5 にわずかに及ばない程度です。

よくある質問

  • コストが爆発しそうなときは:まず小さな目標で試運転し(2〜4時間)、審査 Agent の検収基準が妥当だと確認できてから24時間に引き伸ばす
  • 審査 Agent が手加減するときは:プロンプトに「ブラインドで並べて比較」を明示的に要求し、モデルが自主的に基準を下げることを禁止する。Anshu のリポジトリにある17項目チェックスクリプトのやり方を参考にする
  • モデルが細部にこだわりすぎて止まるときは:手動で介入して優先度を調整する。これは Anshu 本人が24時間の中で繰り返し行ったことです