Step 3.7 Flash を Claude Code に接続:実測ガイド

·Toolin 編集部

StepFun のオープンソース Flash モデルを Claude Code に接続する実測レポート。複雑な Agent ワークフローで、中国製モデルがクローズドソース基盤の代わりを果たせるかを検証

Step 3.7 Flash を Claude Code に接続:実測ガイド

StepFun(階躍星辰)は Step 3.7 Flash をオープンソース化しました。ライセンスは Apache 2.0 で、売りは「agent 効率」――実際のワークフローの中で、一連のチェーンを速く安定して完走することです。公式ドキュメントには、Claude Code、Cline、Roo Code などの主流 agent ツールに直接接続できると明記されています。この記事は1回の完全な実測の記録です。Step 3.7 Flash をベースモデルとして Claude Code を駆動し、複雑度の高い2つの agent ワークフローを走らせ、果たして通用するのかを確かめました。

Step 3.7 Flash とは

Step 3.7 Flash は StepFun が2025年5月末に発表しオープンソース化した Flash モデルです。

  • アーキテクチャ:スパース MoE(Mixture of Experts)。サイズは小さくないが、毎回最も関連性の高い一団の「エキスパート」だけを活性化
  • 速度:最大生成速度は毎秒400トークン、コンテキストは 256K
  • ライセンス:Apache 2.0。GitHub、HuggingFace、ModelScope のいずれでもダウンロード可能
  • ポジショニング:「最も賢い」ではなく、「agent タスクで速く安定している」

Step 3.7 Flash のベンチマーク比較

SWE-Bench、ClawEval などの agent 系ベンチマークでは、同サイズ帯の中でかなり戦える成績を収めています。本当の売りは最高得点ではなく、より小さい活性化パラメータとより速い速度で、この水準を安定的に届けられることです。

Claude Code への接続方法

StepFun の公式ドキュメントには、サポート対象のツールリストが掲載されています。

StepFun 公式ドキュメントのツールリスト

設定手順

  1. StepFun コンソールに登録し、API キーを取得
  2. Claude Code のルーティングを設定:CCR(モデルルーティング)経由で step-3.7-flash を Claude Code に接続
  3. 起動コマンドを設定:stepfun コマンドを設定し、Step 3.7 Flash 駆動の Claude Code を起動
  4. ウェブ検索に対応:ベースモデルを変えると Claude Code ネイティブの検索は使えなくなるため、Tavily の MCP ツールに切り替える必要がある
# 参考設定のイメージ(具体的なパラメータは StepFun 公式ドキュメントを参照)
# Claude Code のモデル設定に step-3.7-flash のルーティングを追加
# 具体的な接続方法は StepFun 公式サイトの harness ドキュメントを参照

ターミナルで step-3.7-flash を実行する Claude Code

ヒント:StepFun の公式サイトには、各ツール(Claude Code、Cline など)の接続方法が詳しく書かれています。自分で設定したくなければ、接続ドキュメントを任意の中国製デスクトップ agent に投げて、代わりに設定してもらうこともできます。

実測結果

テスト1:女媧(深い調査+人物 Skill の生成)

タスクの目標:AI 分野の投資視点の Skill を蒸留すること。

実行プロセス:

  1. 対象を確定した後、一気に 6つのサブエージェントを並列で調査に投入(著作、インタビュー、スタイル、批判、意思決定の記録、最新動向)
  2. 6つの agent のうち最も遅いものは22分かかりましたが、Step 3.7 Flash は並列状態を最後まで制御し、結果を混線させなかった
  3. すべての agent が戻った後、自発的に停止して調査品質のサマリーを提示し、確認を待ってから続行
  4. 6つの核心的思考モデル、8つの意思決定ヒューリスティックを抽出し、実行可能な Skill を1回で生成
  5. 自分で独立したレビュー agent を起動して欠点を探させ、レビュー意見に従ってトリガーワードやファクトチェックなどの細部を補った

女媧の実行プロセス

テスト2:ダーウィン 2.0(複数審査員による Skill 最適化)

タスクの目標:ダーウィン 2.0 を使ってトークショー Skill を最適化すること。

実行プロセス:

  1. git ブランチを作成し、テストケースを設計し、ベースラインのスコアリングを1周実行
  2. 最弱の次元を特定してから反復開始:毎ラウンド、独立したまったく新しい審査員 agent を2つ再起動してブラインド評価
  3. 修正したらすぐ commit、スコアの上昇が足りなければロールバック
  4. 上昇幅が縮まると早期停止メカニズムが自動発火

ダーウィン2.0の実行プロセス

コスト参考

StepFun コンソールの価格に従うと:

  • 入力:100万トークンあたり 1.35 人民元
  • 出力:100万トークンあたり 8.1 人民元

Flash クラスの価格帯で、高頻度で呼び出す agent ワークフローに適しています。

結論

実測の中で、Step 3.7 Flash は2つの重要な特質を示しました。

  1. 通るべき工程を1歩も省かなかった:タスクが複雑だからといってステップを飛ばさず、6つの並列 agent+複数回のレビューをすべて完全に実行
  2. 立ち止まって確認すべき場所では素直に止まった:確認すべきことは勝手に決めず、報告すべきことは自発的に報告

完璧というわけではありません――途中で少数の編集操作でエラーが出ましたが(どちらかと言えばローカルのツール環境の問題)、モデルは引き返して別の方法でリトライすれば通りました。しかし、オープンソースの Flash モデルとして、複雑な agent ワークフローでサブスクリプション版 Claude Code に類似する実行効果を示したのは、すでに期待を超えています。

入手方法

Claude Code や Codex といったツールを使っていて、コストが気になるなら、既存のワークフローに接続でき、オープンソースで、チェーン全体を安定して走り切れるモデルは、確かに試す価値があります。