Claude CodeでTokenを節約する実践ガイド

·Toolin 編集部

プロンプトキャッシュの仕組み、セッション管理の戦略、6つのコアルールを押さえて、Claude Codeのクォータをより長く、より有意義に使えるようにしましょう。

Claude CodeでTokenを節約する実践ガイド

Claude Codeのクォータが減るのが速すぎると感じていませんか?Maxユーザーの1週間分の枠を2日で使い切る人もいれば、1セッションの実コストが134ドルを超えるケースもあります。問題は往々にして使用量の多さではなく、背後にあるキャッシュの仕組みを理解していないことにあります。この記事ではTokenがどう使われているのか、どうすれば節約できるのかを整理します。

プロンプトキャッシュ:Token節約の核心

大規模言語モデルはメッセージを受け取るたびに、入力内容全体を最初から「読み」直します。Claude Codeでは、入力内容には通常、システム指示、ツール定義、CLAUDE.mdのプロジェクトルール、会話履歴、新しいメッセージが含まれます。最初の2つは同じセッション内でほぼ変わりませんが、モデルは毎回読み直しています。

プロンプトキャッシュのやることはシンプルです。最初の計算後に中間結果を保存しておき、次に同じ入力プレフィックスに遭遇したときは保存済みの結果を使って重複計算をスキップします。キャッシュ読み取りのコストは再計算の10分の1です。

ただしキャッシュには2つの前提条件があります:

  • キャッシュは「プレフィックス」にのみ有効:先頭から一字一句違わず一致する必要があります。冒頭の1文字を変えただけで、キャッシュ全体が無効になります。
  • キャッシュには生存時間がある:メインエージェントのキャッシュウィンドウは1時間、サブエージェントは5分です。キャッシュヒットのたびにタイマーが更新されます。

プロンプトキャッシュのイメージ

キャッシュヒットの位置とヒット率が、Tokenコストを直接左右します

常識を覆す3つの節約戦略

キャッシュを理解したうえで、いくつかの「常識」はひっくり返す必要があります。

キャッシュが温かいうちは、新セッションを開くより会話を続けるほうが安い

Claude Codeは新しいセッションを起動するたびに、システムプロンプト、ツール定義、CLAUDE.md、プロジェクト設定を再読み込みします。この「インフラ」部分がおよそ5万Tokenです。頻繁な/clearは、変わらないコンテンツに対して何度も全額の書き込み費用を払うのと同じです。

一方、アクティブなセッション内では、これらのコンテンツはずっとキャッシュにあり、毎回10分の1の価格しか払いません。

複雑なタスクは一度で仕上げるほうが、3往復の修正より安い

拡張思考をオフにすれば、確かに1リクエストあたりのTokenは節約できます。しかし複雑なリファクタリングタスクなら、拡張思考をオンにして一度で済ませるのと、オフにして3往復修正するのとでは、後者のほうが高くつく確率がかなり高い。会話が1巡増えるたびに、コンテキスト全体を再送信することになるからです。

簡単なタスクは逆で、/effortを下げたり/configで思考モードを切ったりすれば、効果は即座に出ます。

長いコンテンツはパスを渡し、会話に貼らない

10000行のログを会話にコピペしてClaudeにエラーを探させる、ということはせず、ログファイルのパスをそのまま渡します。Claude Codeがgrepなどのツールで必要な情報を自ら検索し、関連部分だけをコンテキストに引き込みます。

心に留めて: 一番安いTokenは、コンテキストに入らなかったTokenです。

入力の質がToken消費を決める

出力の長さを制御するより、入力の質を制御するほうが効果的です

会話を続けるか新セッションを開くか:判断表

これはClaude CodeのToken節約における最も重要な判断かもしれません。多くの人のデフォルト習慣は「終わったらクリア」ですが、実際に最も節約になるデフォルトはその逆です。続けられるなら続け、新セッションを開くのは条件付きで発動する操作にします。

現在のセッションを続ける条件:

  • タスクが変わっておらず、同じbugの調整や同じモジュールの作成を続けている
  • 前のメッセージから1時間以内で、キャッシュがまだ生きている
  • コンテキスト内の内容が現在の作業にまだ役立っている

新セッションを開く条件:

  • タスクが変わり、2つの案件のコンテキストがまったく異なる
  • 1時間以上放置していて、キャッシュはほぼ確実に失効している
  • コンテキストが無関係な内容で満たされ、ノイズが多すぎる

ひとことでまとめると:キャッシュが温かくタスクが変わっていないなら会話を続ける。キャッシュが切れた、タスクが切り替わった、コンテキストのノイズが多すぎる、ならば思い切って開き直す。

1セッションで1つのことだけを行う働き方は、ほぼクォータ問題を引き起こしません

1Mコンテキストウィンドウ:慎重に

2026年3月から、Max、Team、EnterpriseプランはデフォルトでOpus 4.6の1Mコンテキストウィンドウを使います。Anthropicは長コンテキストの2倍価格プレミアムを撤廃しましたが、1Mコンテキストは多くの人のクォータ枯渇の最大要因になりつつあります。

問題はキャッシュ失効の代償にあります。1Mコンテキストで長いセッションを積み上げたあと、途中で1時間以上PCを離れ、戻って会話を続けると、1M Token分のキャッシュはすべて失効し、1メッセージで全量の再構築が発火します。

ほとんどの日常的なセッションは80-120Kのコンテキストで圧縮が発動するため、200Kすら使い切らず、まして1Mには届きません。

1Mコンテキストを無効化したい場合は、~/.claude/settings.jsonに次を追加します:

{
  "env": {
    "CLAUDE_CODE_DISABLE_1M_CONTEXT": "1"
  }
}

コンテキストを自動圧縮するしきい値を設定したい場合:

{
  "env": {
    "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "200000"
  }
}

コンテキストが20万Tokenに近づくと自動で圧縮・要約され、コンテキストの連続性を保ちつつ、コストの暴走を防ぎます。

6つのコア運用ルール

1. 日常の作業にはSonnetを使う

Opusの入力コストはSonnetの約1.7倍で、Token消費の速度もSonnetの約2倍です。ほとんどのコーディングタスクはSonnetで十分で、Opusは複雑なアーキテクチャ判断や多段推論のために取っておきます。Claude Code内で/modelを入力して切り替えます。

2. セッション途中でモデルを切り替えない

プロンプトキャッシュはモデルごとに分かれています。Opusで10万Tokenのキャッシュを積んだあとSonnetに切り替えて簡単な質問をすると、Sonnetはゼロから自分のキャッシュを築き直すことになります。軽量モデルが必要な場面では、メインモデルを切り替えるのではなくサブエージェントを使います。

3. CLAUDE.mdを痩せさせ、スキル数を管理する

CLAUDE.mdの内容は毎回のリクエストに注入されます。公式の推奨は200行以内に抑え、本当に長期的に有効なルールだけを残すこと。スキルも多ければ良いわけではなく、使っていないMCPサービスは忘れずオフにします。

小技:CLAUDE.md内にHTMLコメントでメンテナー向けの備考を書くと、Claudeはコンテキスト注入前にコメントを剥がすため、Tokenを消費しません。

4. コマンドラインを優先、MCPはその次

GitHubのghコマンドラインツールはGitHub MCPサーバーよりはるかに少ないTokenで済みます。コマンドラインで解決できることは、MCPを入れないことです。

5. まず少しTokenを使って計画を立てる

複雑なタスクは先にプランモードに入り、Claudeにコードを探索させて案を出させてから実装に入ります。本当に高くつくのは、方向が間違っていたあとにコードを再調査し、実装を書き直し、テストをやり直すことです。

6. permissions.denyで読み取り範囲を制限する

.claude/settings.jsonでpermissions.denyを使い、モデルが読み取れる範囲を厳しく制限します:

{
  "permissions": {
    "deny": [
      "Read(./.env)",
      "Read(./.env.)",
      "Read(./secrets/)",
      "Read(./node_modules/)",
      "Read(./build)"
    ]
  }
}

発生源で不要なファイル読み取りを減らし、Tokenの浪費を防ぐ

タスクの委譲でメインセッションの消費を減らす

サブエージェント:Claude Codeのサブエージェントは独立したコンテキストを持ち、完了すると短い要約だけをメインセッションへ返します。コードレビュー、テスト実行、ドキュメント調査といった作業の詳細出力はメインセッションに残らず、以後のすべてのメッセージでこれらのコンテンツに支払う必要がありません。

Codexプラグイン:OpenAIサブスクリプションも持っているなら、次のコマンドで一部のタスクを外に出している人もいます:

claude mcp add codex -- npx -y @openai/codex-plugin-cc

委譲に向いているもの:構造化されたbug修正、コードレビュー、テスト作成。Claude Codeに残すもの:アーキテクチャ設計、ファイル横断のリファクタリング、コードベース全体の理解が要る複雑な作業。

まとめ

Token節約のコア思考はひとことで:キャッシュができるだけ多くヒットするようにし、コンテキストには無関係な内容をできるだけ入れない。

新セッションを開くのは手段にすぎません。プロンプトキャッシュを理解すれば、「アクティブなセッションで作業を続ける」ことがデフォルト戦略であり、「新セッションを開く」のは特定条件で発動する最適化操作だと分かります。

関連記事

OpenWorker:呉恩達(Andrew Ng)がオープンソース化したデスクトップAI同僚、成果物をそのまま納品できる
AI製品

OpenWorker:呉恩達(Andrew Ng)がオープンソース化したデスクトップAI同僚、成果物をそのまま納品できる

呉恩達(Andrew Ng)がオープンソース化した OpenWorker(MIT)は、ローカル優先・モデル非依存のデスクトップ Agent。25以上のツールに接続し、「顧客向けブリーフを準備して」を、開ける成果物のドキュメントに変えてくれます。

Toolin 編集部
AutoMIA:画像2枚から3Dプリント可能な鏡像イリュージョンを生成、RTX 3090の1枚で動く
AI製品

AutoMIA:画像2枚から3Dプリント可能な鏡像イリュージョンを生成、RTX 3090の1枚で動く

清華大学発 CVPR'26 Highlight のオープンソースプロジェクト AutoMIA。画像2枚を入れるだけで、3Dプリント可能な体素の鏡像イリュージョンアートモデル(STL-ready)を生成できます。RTX 3090 の1枚で、1デザイン約76秒。

Toolin 編集部
Macaron-V1:MoLで個人の経験をLoRAへ圧縮するオープンソースCoding大規模モデル
AI製品

Macaron-V1:MoLで個人の経験をLoRAへ圧縮するオープンソースCoding大規模モデル

心洲科技 Mind Lab がオープンソース化した Macaron-V1(Venti/Coding-Venti/Tall の3段階)。GLM-5.2 744B + 1B LoRA エキスパート4つからなる Mixture-of-LoRA アーキテクチャで、無料 hosted API と UI4A プラグインも提供します。

Toolin 編集部
UniWorld-View:1枚の画像/動画から任意のカメラ軌跡を生成、WorldScore首位の完全オープンソース
AI製品

UniWorld-View:1枚の画像/動画から任意のカメラ軌跡を生成、WorldScore首位の完全オープンソース

北京大学 + 兔展智能 + 鵬城実験室がオープンソース化した UniWorld-View は、1枚の画像/動画から任意のカメラ軌跡の新視点動画を生成し、李飛飛チームの WorldScore ランキングで首位。コードと重みは Apache-2.0 で完全オープンソース、ワンクリックダウンロードにも対応します。

Toolin 編集部
Claude Managed Agentsの6項目更新:スキル上限を500へ引き上げ、実践APIペイロード付き
AI製品

Claude Managed Agentsの6項目更新:スキル上限を500へ引き上げ、実践APIペイロード付き

Anthropic のマネージドエージェントプラットフォーム CMA が6項目の更新を一挙公開。セッションのスキル数は20から500へ引き上げられ、effort の5段階を per-agent のモデル設定へ書き込めるほか、initial_events 付きでシードセッションを1ステップ生成できます。

Toolin 編集部
DojoAgents:10分でローカルに金融リサーチエージェントを構築する
AIチュートリアル

DojoAgents:10分でローカルに金融リサーチエージェントを構築する

深涌智能(Alpha-Dojo)がオープンソース化したエージェントフレームワーク。A株/米国株/香港株に対応し、市場のメイントレンドを自律的に分析する金融リサーチエージェントを10分でローカル構築できます。

Toolin 編集部