Xiaomi MiMo-V2.5-Pro-UltraSpeed:1T モデルが 1000 tokens/s を叩き出す

·Toolin 編集部

Xiaomiの旗艦高速推論モデル。標準的な8基GPUノードで1000 tokens/s超の出力を実現し、出力単価は18元/100万tokens

Xiaomi MiMo-V2.5-Pro-UltraSpeed:1T モデルが 1000 tokens/s を叩き出す

XiaomiのMiMoチームとAI推論システムチームTileRTが共同で投入したMiMo-V2.5-Pro-UltraSpeedは、いわば「常識破り」のモデルです。兆パラメータ(1T)のMoEモデルを標準的な8基構成の汎用GPUノード1台に載せ、出力速度として初めて1000 tokens/sを突破し、ピークは約1200 tokens/s——しかもこの速度は、CerebrasのウェハースケールチップもGroqのカスタムSRAMもといった専用ハードウェアに依存しません。モデルの公開から2週足らずで6.6万件を超える利用申請が届き、6月23日終了予定だった体験期間は延長を余儀なくされました。本記事はその技術経路、価格、申請方法を分解し、どこが「速い」のか、使う価値があるのかを見極める材料を提供します。

MiMo-V2.5-Pro-UltraSpeed とは

一言で定義すると:Xiaomiが汎用ハードウェアで1000 tokens/sを達成した兆パラメータ旗艦モデルです。

  • アーキテクチャ:MoE(Mixture of Experts)
  • 総パラメータ数:1T(兆)
  • 活性パラメータ:1回の順伝播で約420億
  • コンテキスト長:100万トークン対応
  • 核心的ブレークスルー:8基汎用GPUノードで安定した1000 tokens/s出力、ピーク約1200 tokens/s

Xiaomi MiMoの告知では、申請量が「想定を大きく上回った」ため、公開期間の延長を決めたとしています。

速度:業界座標の中の位置

1000 tokens/sを業界座標に置くと、その衝撃は非常に明確です。AIベンチマークプラットフォームArtificial Analysisのデータによると、

モデル出力速度(約)
GPT-5.562-68 tokens/s
Claude Opus71 tokens/s
Gemini Flash192-200 tokens/s
MiMo-V2.5-Pro-UltraSpeed1000-1200 tokens/s

つまりUltraSpeedの出力速度は最先端クラスのモデルより1桁速く、リアルタイム対話、ストリーミングコード生成、長文の一括生産といったレイテンシ敏感シーンでは、体験の差は質変レベルです。

どう実現したのか:モデル側+システム側の協調最適化

鍵は、専用ハードウェアに頼らず、モデル側とシステム側の協調最適化で汎用GPUの性能を絞りきった点にあります。

モデル側

  • FP4混合量子化:主にMoE ExpertにFP4量子化を適用し、他のモジュールは高めの精度を保持。モデルサイズとメモリアクセス圧力を低減
  • DFlash投機的デコーディング:従来のDraftモデルによるトークン逐次自己回帰をブロックレベルのMasked並列予測に置き換え、大モデルが一度により多くの候補トークンを検証できるように

Hugging Faceでオープンソース化された MiMo-V2.5-Pro-FP4-DFlash モデルカードはUltraSpeedの土台となるモデルで、FP4量子化backbone+BF16 DFlash drafterを含み、ライセンスはMITです。

システム側

  • TileRTがFP4量子化とDFlashフローのためにコンパイルエンジンと計算カーネルを専用設計
  • 常駐カーネルエンジンと異種パイプライン協調で、オペレータ起動と同期のオーバーヘッドを削減

価格:3倍の値段で10倍の速度

UltraSpeed APIは期間限定の体験価格で、標準版MiMo-V2.5-Proの3倍の価格設定ながら、約10倍の出力速度向上を提供します。

課金項目標準版 MiMo-V2.5-ProUltraSpeed
キャッシュヒット入力0.025元/100万tokens標準版の3倍
キャッシュミス入力3元/100万tokens標準版の3倍
出力6元/100万tokens18元/100万tokens(約2.65ドル)

参考までに、Anthropicの旗艦Claude Opusの公開価格は入力5ドル/100万tokens(約34元)、出力25ドル/100万tokens(約170元)です。UltraSpeedの出力価格はClaude Opusの約1.5%にすぎず、速度は十数倍——もちろんモデル能力の次元を単純にイコールで結べはしませんが、このコストパフォーマンスはスループット密集型ビジネスに非常に有利です。

雷軍はWeiboで投稿し、MiMo-V2.5-Pro-UltraSpeedの新たな進展を発表しました。

申請・利用方法

現時点でモデルはまだ期間限定体験段階で、審査通過済みユーザーは引き続き利用でき、未申請の場合はクローズドベータ申請が必要です。

  • API申請入口:https://platform.xiaomimimo.com/ultraspeed
  • Chat体験入口:https://ultraspeed.xiaomimimo.com
  • 土台モデルのオープンソース:https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash(MITライセンス)

6月23日時点で、6.6万件を超える利用申請を受けており、申請者にはフォーチュン・グローバル500企業、業界トップ企業、個人開発者が含まれ、法律、金融、通信、物流、自動車製造、文化メディア、大学などの分野をカバーしています。

応用シーン

1000 tokens/sの速度は、従来「待てない」だったシーンの一群を解放します。

  • リアルタイム対話とカスタマーサポート:初回トークンとストリーミング出力のレイテンシがほぼリアルタイムに近く、体験が質変
  • ストリーミングコード生成:コーディングAgentの複数回の反復がもう引っかからない
  • 長文の一括生産:レポート、マーケティングコピー、ナレッジベース整理のスループットが大幅向上
  • マルチAgent協調:Agent間の高頻度呼び出しはレイテンシに敏感で、超高速出力は総所要時間を大幅に短縮
  • 教育と話し相手:口語的で即時フィードバックのシーンは応答速度への要求がきわめて高い

議論と制限

  • 「兆パラメータ」の比較可能性:海外開発者コミュニティでは、MoEアーキテクチャにおける「兆パラメータ」とDenseモデルの比較可能性を疑う声があり、実際に活性化する420億パラメータという口径の整理が必要
  • エコシステムの成熟度:Claude、GPTなどの成熟したエコシステムに比べ、MiMoのツールチェーン、Agentフレームワーク対応はまだ整備途中
  • 能力次元の客観的な差:速度優勢を推論能力の優勢と直接イコールで結ぶことはできず、複雑推論や長いチェーンを持つAgentタスクでの実際の効果は、まずChat入口で自ら試すことをおすすめします

💡 ヒント:もしあなたのビジネスがスループット密集型(カスタマーサポート、一括生産、マルチAgent協調)なら、UltraSpeedのコストパフォーマンスは極めて魅力的です。中核ニーズが複雑推論なら、まずChat入口で数ラウンドのベンチマークを行ってから移行するかを判断しましょう。

関連記事

チャットのように CAD モデリング:浙江大学発オープンソース CADDesigner 実践ガイド
AI製品

チャットのように CAD モデリング:浙江大学発オープンソース CADDesigner 実践ガイド

一文の入力やラフスケッチから CADDesigner が 3D モデルを自動生成。浙江大学がオープンソース化した LLM 駆動 CAD エージェントの使い方と注意点を解説します。

Toolin 編集部
歌歌AI(GoGoAI):中国初のピュア中国語 AI 音楽モデルを実測解説
AI製品

歌歌AI(GoGoAI):中国初のピュア中国語 AI 音楽モデルを実測解説

中国語の歌唱に特化して最適化され、シングルGPU 10秒で中国語曲を1曲生成。Douyin(抖音)や剪映など7つのプラットフォームに接続済みの歌歌AI について、モデル能力・接続方法・クリエイターの収益化経路を解説します。

Toolin 編集部
HuggingFace ランキングを制した MemSlides:あなたの好みを覚えてくれる PPT Agent
AI製品

HuggingFace ランキングを制した MemSlides:あなたの好みを覚えてくれる PPT Agent

清華大学・上海交通大学・北京郵電大学の共同オープンソース MemSlides は、記憶駆動の PPT 生成 Agent で、パーソナライズされたスタイルと複数回の部分修正に対応し、HuggingFace ランキングで首位を獲得しました。

Toolin 編集部
ShotStream:マルチショット長編動画をリアルタイムに演出するオープンソースフレームワーク(ECCV 2026)
AI製品

ShotStream:マルチショット長編動画をリアルタイムに演出するオープンソースフレームワーク(ECCV 2026)

香港中文大学 MMLab と Kuaishou Kling が共同オープンソース化した ShotStream は、初のリアルタイムストリーミング型マルチショット長編動画生成フレームワークで、生成速度は約25倍に向上し、生成しながらのストーリー調整に対応します。

Toolin 編集部
Volcengine Seedance 2.0 API 連携実践ガイド:申請から最初の動画生成まで
AIチュートリアル

Volcengine Seedance 2.0 API 連携実践ガイド:申請から最初の動画生成まで

開発者向け Seedance 2.0 動画 API 連携ガイド。Ark プラットフォームの有効化、API 呼び出し、SDK サンプル、TOS ストレージ、料金面の注意点を網羅します。

Toolin 編集部
Claude Artifacts がついに公開共有+複数人リアルタイム編集に対応
AI製品

Claude Artifacts がついに公開共有+複数人リアルタイム編集に対応

Anthropic が Artifacts に公開リンク共有と複数人による同時編集(multiplayer)を追加。この機能の正体、使い方、そして Claude Code Artifacts との違いを解説します。

Toolin 編集部