NetflixがHeadroomをオープンソース化:冗長トークンの90%を削り、70万ドルを節約

·Toolin 編集部

Netflixのシニアエンジニアが開発したオープンソースツールHeadroomは、指示が大モデルに到達する前に冗長トークンを圧縮する。可逆圧縮でコンテキストをロスなしに保ち、すでにユーザーの70万ドルを節約した。

NetflixがHeadroomをオープンソース化:冗長トークンの90%を削り、70万ドルを節約

エンジニアに AI の積極利用を奨励すると、巨額の請求書が届くかもしれない——Uber と Microsoft の COO はすでにこれを味わった。Netflix のシニアエンジニア Tejas Chopra が開発したオープンソースツール Headroom は、指示が大モデルに到達する前にトークン単位で圧縮・簡素化し、最大90%の冗長トークンを削れると試算されている。2025年1月に公開され、いまだ v0.22 という小さなツールは、すでにユーザーのためにおよそ70万ドル(トークン換算で約2000億)を節約した。もしチームが AI の請求書に焼かれているなら、このツールは一見の価値がある。

Headroom はすでにユーザーのために約70万ドルを節約し、2000億トークンを圧縮

Headroom とは

Headroom は Python と Node ベースのローカルプロキシツールで、エンジニアのデバイス上で動作する(デフォルトの待受ポートは8787)。大規模言語モデルクライアントをラップ(wrap)する形で動き、入力内容を自動で解析して圧縮する。

最も簡単な使い方は、コマンドラインで LLM クライアントをラップすることだ:

headroom wrap codex

ツールはモデルへ送られるすべてのリクエストを自動で横取りし、大モデルに到達する前に圧縮を完了する。GitHub リポジトリ:github.com/chopratejas/headroom。すでに2000以上の Star、120以上の Fork がある。

何を圧縮しているのか

Claude Sonnet からの287ドルの請求書が、Chopra にトークンコスト問題を初めて認識させた。念入りに調べた彼が見つけたのは、問題が手書きの指示ではなく、付帯する各種のボイラープレートコードと機械メタデータだったことだ:

  • 冗長で煩雑な JSON 構造
  • API 返却内容の中で何層にもネストされたテンプレート
  • 大量に重複するデータベースフィールド

「これは散文でもクリエイティブライティングでもなく、テキストに偽装された圧縮可能なデータだ」と Chopra は書いている。2025年のある研究グループの発見では、ユーザー入力の読み取りが全トークン消費の約76%を占める。

Headroom が最も得意とするのは、このあたりの内容だ:

  • サーバーログ:約90%は捨てられる
  • MCP ツール出力:約70%が冗長 JSON
  • データベース出力とファイルツリー:大量に重複するメタデータ

4ステップの処理フロー

ステップ1:CacheAligner(キャッシュ整合)

すでに入力済みの内容の中から変化した情報だけを探し、大モデルには追加分だけを送る。KV キャッシュ内の大部分の未変更全文を置き換える操作を省く。

💡 ヒント:システムプロンプトに日付フィールドや、ラウンドごとに自動変化する UUID が含まれていると、呼び出しごとにキャッシュミスが起き、コストが急騰する。Headroom はこの種の問題を自動で識別・処理する。

ステップ2:ルーティングによるデータ型識別

ルーティング処理でデータ型を識別し、対応する圧縮器へ送る:

  • AST 圧縮器:プログラムコードを圧縮(抽象構文木)
  • JSON 圧縮器:冗長 JSON を除去
  • DOM 圧縮器:ウェブページのテンプレートコードを除去

さらに一式の簡素化プロセッサがあり、統計分析に基づいて有効な内容を選別し、フィードバックループで圧縮度を反復最適化する——モデルが元の非圧縮プロンプトを取り出した頻度に基づき、圧縮が過剰か不足かを判断する。

ステップ3:CCR(圧縮キャッシュと読み出し)

これが Headroom と他のトークン圧縮ツールの最大の違いだ。可逆圧縮である。

データ圧縮の箇所にマーカーを打ち、万一、大モデルが元のコンテキストを必要とすれば、Headroom MCP 経由でユーザーのローカルデバイスから該当内容を引き出せる。元データは Redis または SQLite データベースに一元保管される。

ステップ4:モデルが必要時に取得

モデルは必要なときに Headroom MCP 経由で能動的に元の非圧縮データをリクエストするのであって、受動的に全内容を受け取るわけではない。この仕組みにより、圧縮をより攻撃的にしながら正確性を保証できる。

コアの優位性:可逆圧縮

市場にはトークン圧縮ツールが不足していないが、Headroom の独自性はロスなし可逆にある:

  • 商用案:Token Company(Y Combinator 投資)。トークン圧縮 as a Service を提供。
  • オープンソース案:RTK(Rust Token Killer)は冗長なコマンド出力を刈り込む。LeanCTX は RTK の変種。

これらのツールも有用だが、Headroom は操作を開発者のワークフローに組み込み、他のアプリには提供できない機能——可逆圧縮——を備えている。モデルベンダー提供のキャッシュ方案にも限界がある。Claude のプレフィックスキャッシュはデフォルトでわずか5分で、アイドル後はコンテキストウィンドウ全体を刷新しなければならない。1時間 TTL の構成は存在するが、「書き込みコストが倍増してようやく読み取り時に90%の節約が得られる」のだ。

なぜトークンを圧縮するのか

コスト削減以外にも、トークンの圧縮には重要な利点が2つある。

ひとつはモデル出力品質の向上だ。 エージェントが押し付けるコンテキストがモデルに実際に必要な量を超えると、コストが増えるだけでなく、生成品質も悪化する。スタンフォード大学の研究では、大モデルはコンテキストウィンドウの冒頭と末尾に強く注意を向け、中間部分を見落としやすいことが分かった。データインテグレーターの Chroma の研究チームは、この現象を「コンテキスト劣化(Context Rot)」と呼んだ——18種の大モデルにおいて、入力テキストが長いほど出力の安定性は低下した。

ふたつめは応答レイテンシの低下だ。 Chopra は、Headroom を音声対話アプリ用に複製したユーザーがいると述べている——音声の場合、沈黙であってもトークンが発生し、自然に聞こえるには200ミリ秒以内の応答が求められる。Headroom はレイテンシのウィンドウを最大限短縮できる。

応用シーン

Headroom はこういうユーザーに向く:

  • AI 請求書に焼かれているチーム:とりわけ Agent ワークフローをヘビーに使い、コンテキストに大量のツール出力とログが頻繁に含まれるシーン。
  • 音声対話アプリ:レイテンシに敏感で、入力の最大限の圧縮が必要なシーン。
  • 消費電力を意識するチーム:トークンが少ないほどコンテキストウィンドウが小さく、エネルギー消費も減る。

⚠️ 注意:Chopra 自ら、このツールスタックにはまだ改善の余地があり、特にテストの正確性の面だと認めている。ただし CCR が元のプロンプトを保管しているため、今後金融データなど特殊なデータ型向けの専用圧縮器を開発できる。まず重要度の低いワークフローで効果を検証してから、本番環境へ広げることをおすすめする。

関連プロジェクトの Headlight がまもなくオープンソース化される。こちらは各トークンの出所を追跡するもので、マルチモデル作業の正確性確保に特に有用かもしれない。

関連記事

Doubao Seed-Audio 1.0 実測:キャラ対話・効果音・BGMを一度に生成
AI製品

Doubao Seed-Audio 1.0 実測:キャラ対話・効果音・BGMを一度に生成

Volcano Engine の Seed-Audio 1.0 は映像級の全要素ダイレクト出力へ進化。1本のプロンプトで多キャラの対話、効果音、BGMを生成し、完成映像級の音に迫ります。

Toolin 編集部
WeChat の AI アシスタント「小微」実測:12シーンで能力と境界を見極める
AI製品

WeChat の AI アシスタント「小微」実測:12シーンで能力と境界を見極める

WeChat 標準の AI アシスタント「小微」がグレースケールテストで解放。Tencent 自社開発の WeLM モデルを基盤に、メッセージ送信、支払い照会、モーメンツ分析に対応する一方、定期送信や一括操作は現時点で非対応です。

Toolin 編集部
Alibaba HappyHorse 1.1 実測:ベタつき感が引き、1080P はさらに25%値下げ
AI製品

Alibaba HappyHorse 1.1 実測:ベタつき感が引き、1080P はさらに25%値下げ

Alibaba が動画生成モデル HappyHorse 1.1 をリリース。5つの軸でアップグレードし、1080P の価格は1秒あたり1.2人民元から0.9人民元へ。実測比較と体験URLを併記します。

Toolin 編集部
Baidu が Unlimited OCR をオープンソース化:アクティブ500Mの小モデルが40ページを一息に記憶喪失なしで読み切る
AI製品

Baidu が Unlimited OCR をオープンソース化:アクティブ500Mの小モデルが40ページを一息に記憶喪失なしで読み切る

Baidu がオープンソース化した Unlimited OCR は、総パラメータ3B / アクティブ500MのエンドツーエンドOCRモデル。OmniDocBench の SOTA を更新し、単一推論で数十ページの文書を記憶喪失なしに転写します。

Toolin 編集部
Sakana Fugu:自らは答えず、他のモデルに指示して仕事をさせるオーケストレーター
AI製品

Sakana Fugu:自らは答えず、他のモデルに指示して仕事をさせるオーケストレーター

Sakana AI がオーケストレーターモデルの Fugu シリーズをリリース。GPT、Claude、Gemini の賢いスケジューリングでタスクを完了し、性能は Fable 5 と Mythos Preview に迫ります。

Toolin 編集部
Seko 無限キャンバスを実践:アイデアを放り込めば、Agent が AI 動画を一本仕上げる
AIチュートリアル

Seko 無限キャンバスを実践:アイデアを放り込めば、Agent が AI 動画を一本仕上げる

Seko 無限キャンバス + Seedance 2.0 の実践ガイド。720P コストは50%ダイレクト値下げ、1080P は80%ダウンで、初心者でも10分で複数エピソードの AI 動画作品を作れます。

Toolin 編集部