NetflixがHeadroomをオープンソース化:冗長トークンを90%削減し、70万ドルを節約
Netflixのシニアエンジニアがオープンソース化したHeadroom(v0.22)はローカルプロキシとして大モデルへの入力を一旦受け止め、ログ、JSON、コードに可逆圧縮を施す。すでにユーザーのために約70万ドル、2000億トークンを節約した。


NetflixがHeadroomをオープンソース化:冗長トークンを90%削減し、70万ドルを節約
Netflixのシニアエンジニアがオープンソース化したHeadroom(v0.22)はローカルプロキシとして大モデルへの入力を一旦受け止め、ログ、JSON、コードに可逆圧縮を施す。すでにユーザーのために約70万ドル、2000億トークンを節約した。
AIの請求書は多くのチームの悩みの種になりつつある。UberやMicrosoftのCOOも経験済みだ:エンジニアにAIの利用を奨励すると、請求額が人員削減で浮いた金額を相殺しかねない規模になる。NetflixのシニアエンジニアTejas Chopraがオープンソースの解決策を提示した——Headroom(v0.22)だ。あなたと大模型の間で「水門」として振る舞い、指示文に含まれる最大90%の冗長トークンを切り落としてから送信する。今年1月にオープンソース化されたばかりのこのプロジェクトは、すでにユーザーのために約70万ドル、2000億トークンを節約し、GitHubで2000個のスターを獲得している。
この記事では、Headroomが解決する問題、仕組み、導入方法をはっきり説明する。
何を解決するのか
Claude Sonnetからの287ドルの請求がきっかけで、Chopraはトークンコストの調査を始めた。彼が発見したのは、自分で手書きした指示文は大した額ではなく、真犯人は付随する機械生成メタデータだということだ——何層にもネストされたJSON、APIが返すテンプレート、重複するデータベースフィールド、サーバーログ。
「これは散文の執筆でもクリエイティブな写作でもなく、テキストの姿をした圧縮可能なデータだ。」
ある2025年の研究では、ユーザー入力の読み込みが全トークン消費の約 76% を占めることが分かった。モデルベンダーはプレフィックスキャッシュなどの最適化を提供しているが、デフォルトのTTLはわずか5分で、しかも書き込みコストを2倍にしてようやく読み取り90%の削減と引き換えになる。バランスポイントは自分で探るしかない。
Headroomの仕組み
HeadroomはPythonとNodeを基盤に、ローカルプロキシ(ポート8787)としてエンジニアのデバイス上で動き、指示文が大モデルへ到達する前に圧縮を完了する。全体の流れはいくつかのステップに分かれる:

- CacheAligner:すでに入力済みの内容から変化点だけを探し、追加分だけを大モデルへ送り、KVキャッシュ全体の再構築を避ける。システムプロンプトに毎回変わる日付やUUIDが含まれていると本来は毎回キャッシュミスするはずだが、このステップで直接塞げる。
- ルーティングがデータ型を識別:対応する圧縮器へ自動振り分け。
- 型専用圧縮器:
- AST圧縮器:プログラムコードを圧縮(抽象構文木)
- JSON圧縮器:冗長なJSONを除去
- DOM圧縮器:Webテンプレートコードを削減
- 精簡プロセッサ:統計分析に基づいて有効な内容を選別し、フィードバックループで反復する——大モデルが圧縮前の元のプロンプトを引き戻す頻度に基づき、圧縮が過剰かを判断する。
- CCR(圧縮キャッシュと読み取り):大モデルが必要な時に元データを呼び戻せるようにする。圧縮箇所にはマーカーを打ち、大モデルはHeadroom MCP経由でローカルのRedisやSQLiteから対応する元の内容を取得できる。
各データ型の圧縮可能比率(実測):
| データ型 | 破棄可能比率 |
|---|---|
| サーバーログ | ~90% |
| MCPツール出力(冗長JSON) | ~70% |
| データベース出力/ファイルツリー | 大量の重複メタデータ |
重要な違い:可逆圧縮
Headroomと市販の他のトークン削減ツールの最大の違いは 可逆 なことだ。商用ではY Combinatorが出資するToken Companyが「圧縮 as a Service」を提供し、オープンソース界隈にはRTK(Rust Token Killer)が冗長な出力を刈り取り、LeanCTX(RTKの派生)がある。どのツールも有用だが、その多くは非可逆の刈り取りだ。
Headroomは元のプロンプトをローカル(Redis / SQLite)に完全な形で残し、大モデルはいつでも完全なコンテキストを呼び戻せる。つまり圧縮を大胆に進めても情報は失われず、圧縮が過剰かどうかはモデル自身の「引き戻し頻度」というフィードバックで決まる。
💡 ヒント:トークンの削減はコスト削減だけでなく、出力品質の向上にもつながる。Stanfordの研究では、大モデルはコンテキストの冒頭と末尾に注目し、中間を見落としやすいことが分かっている。Chromaチームは18種の大モデルで「入力が長いほど出力の安定性が落ちる」ことを観察し、「コンテキスト腐食(Context Rot)」と名付けた。
使い方
Headroomはコマンドラインで大モデル呼び出しをラップする:
headroom wrap codexツールが入力内容を自動解析して圧縮する。最も得意なのは、サーバーログ、MCPツール出力、データベース出力、ファイルツリーの削減だ。
GitHubリポジトリ:https://github.com/chopratejas/headroom
誰に向くか
- トークン請求書に火傷した開発者:とくにMCPツール、RAG検索、長いログ分析を多用するエージェントワークフロー。
- 音声対話アプリ:レイテンシ敏感なシーン(ユーザーは200ms以内の応答を期待)では、トークンが少ないほど遅延も短い。すでにHeadroomを音声アプリに転用したユーザーもいる。
- 消費エネルギーを気にするチーム:トークン削減=コンテキストウィンドウ縮小=消費電力削減。
既知の限界
Chopraは、ツールスタックはまだ改良途上で、とくにテストの正確性の面だと率直に語る。音声、画像、動画の圧縮はまだ手つかずだ(動画解析への転用例はある)。関連プロジェクトのHeadlightはまもなくオープンソース化され、各トークンの出所を追跡して、マルチモデル協働の正確性に役立つという。