Xiaomi MiMo-V2.5-Pro-UltraSpeed:1T モデルが 1000 tokens/s を叩き出す
Xiaomiの旗艦高速推論モデル。標準的な8基GPUノードで1000 tokens/s超の出力を実現し、出力単価は18元/100万tokens


Xiaomi MiMo-V2.5-Pro-UltraSpeed:1T モデルが 1000 tokens/s を叩き出す
Xiaomiの旗艦高速推論モデル。標準的な8基GPUノードで1000 tokens/s超の出力を実現し、出力単価は18元/100万tokens
XiaomiのMiMoチームとAI推論システムチームTileRTが共同で投入したMiMo-V2.5-Pro-UltraSpeedは、いわば「常識破り」のモデルです。兆パラメータ(1T)のMoEモデルを標準的な8基構成の汎用GPUノード1台に載せ、出力速度として初めて1000 tokens/sを突破し、ピークは約1200 tokens/s——しかもこの速度は、CerebrasのウェハースケールチップもGroqのカスタムSRAMもといった専用ハードウェアに依存しません。モデルの公開から2週足らずで6.6万件を超える利用申請が届き、6月23日終了予定だった体験期間は延長を余儀なくされました。本記事はその技術経路、価格、申請方法を分解し、どこが「速い」のか、使う価値があるのかを見極める材料を提供します。
MiMo-V2.5-Pro-UltraSpeed とは
一言で定義すると:Xiaomiが汎用ハードウェアで1000 tokens/sを達成した兆パラメータ旗艦モデルです。
- アーキテクチャ:MoE(Mixture of Experts)
- 総パラメータ数:1T(兆)
- 活性パラメータ:1回の順伝播で約420億
- コンテキスト長:100万トークン対応
- 核心的ブレークスルー:8基汎用GPUノードで安定した1000 tokens/s出力、ピーク約1200 tokens/s
Xiaomi MiMoの告知では、申請量が「想定を大きく上回った」ため、公開期間の延長を決めたとしています。
速度:業界座標の中の位置
1000 tokens/sを業界座標に置くと、その衝撃は非常に明確です。AIベンチマークプラットフォームArtificial Analysisのデータによると、
| モデル | 出力速度(約) |
|---|---|
| GPT-5.5 | 62-68 tokens/s |
| Claude Opus | 71 tokens/s |
| Gemini Flash | 192-200 tokens/s |
| MiMo-V2.5-Pro-UltraSpeed | 1000-1200 tokens/s |
つまりUltraSpeedの出力速度は最先端クラスのモデルより1桁速く、リアルタイム対話、ストリーミングコード生成、長文の一括生産といったレイテンシ敏感シーンでは、体験の差は質変レベルです。
どう実現したのか:モデル側+システム側の協調最適化
鍵は、専用ハードウェアに頼らず、モデル側とシステム側の協調最適化で汎用GPUの性能を絞りきった点にあります。
モデル側
- FP4混合量子化:主にMoE ExpertにFP4量子化を適用し、他のモジュールは高めの精度を保持。モデルサイズとメモリアクセス圧力を低減
- DFlash投機的デコーディング:従来のDraftモデルによるトークン逐次自己回帰をブロックレベルのMasked並列予測に置き換え、大モデルが一度により多くの候補トークンを検証できるように
Hugging Faceでオープンソース化された MiMo-V2.5-Pro-FP4-DFlash モデルカードはUltraSpeedの土台となるモデルで、FP4量子化backbone+BF16 DFlash drafterを含み、ライセンスはMITです。
システム側
- TileRTがFP4量子化とDFlashフローのためにコンパイルエンジンと計算カーネルを専用設計
- 常駐カーネルエンジンと異種パイプライン協調で、オペレータ起動と同期のオーバーヘッドを削減
価格:3倍の値段で10倍の速度
UltraSpeed APIは期間限定の体験価格で、標準版MiMo-V2.5-Proの3倍の価格設定ながら、約10倍の出力速度向上を提供します。
| 課金項目 | 標準版 MiMo-V2.5-Pro | UltraSpeed |
|---|---|---|
| キャッシュヒット入力 | 0.025元/100万tokens | 標準版の3倍 |
| キャッシュミス入力 | 3元/100万tokens | 標準版の3倍 |
| 出力 | 6元/100万tokens | 18元/100万tokens(約2.65ドル) |
参考までに、Anthropicの旗艦Claude Opusの公開価格は入力5ドル/100万tokens(約34元)、出力25ドル/100万tokens(約170元)です。UltraSpeedの出力価格はClaude Opusの約1.5%にすぎず、速度は十数倍——もちろんモデル能力の次元を単純にイコールで結べはしませんが、このコストパフォーマンスはスループット密集型ビジネスに非常に有利です。
雷軍はWeiboで投稿し、MiMo-V2.5-Pro-UltraSpeedの新たな進展を発表しました。
申請・利用方法
現時点でモデルはまだ期間限定体験段階で、審査通過済みユーザーは引き続き利用でき、未申請の場合はクローズドベータ申請が必要です。
- API申請入口:
https://platform.xiaomimimo.com/ultraspeed - Chat体験入口:
https://ultraspeed.xiaomimimo.com - 土台モデルのオープンソース:
https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash(MITライセンス)
6月23日時点で、6.6万件を超える利用申請を受けており、申請者にはフォーチュン・グローバル500企業、業界トップ企業、個人開発者が含まれ、法律、金融、通信、物流、自動車製造、文化メディア、大学などの分野をカバーしています。
応用シーン
1000 tokens/sの速度は、従来「待てない」だったシーンの一群を解放します。
- リアルタイム対話とカスタマーサポート:初回トークンとストリーミング出力のレイテンシがほぼリアルタイムに近く、体験が質変
- ストリーミングコード生成:コーディングAgentの複数回の反復がもう引っかからない
- 長文の一括生産:レポート、マーケティングコピー、ナレッジベース整理のスループットが大幅向上
- マルチAgent協調:Agent間の高頻度呼び出しはレイテンシに敏感で、超高速出力は総所要時間を大幅に短縮
- 教育と話し相手:口語的で即時フィードバックのシーンは応答速度への要求がきわめて高い
議論と制限
- 「兆パラメータ」の比較可能性:海外開発者コミュニティでは、MoEアーキテクチャにおける「兆パラメータ」とDenseモデルの比較可能性を疑う声があり、実際に活性化する420億パラメータという口径の整理が必要
- エコシステムの成熟度:Claude、GPTなどの成熟したエコシステムに比べ、MiMoのツールチェーン、Agentフレームワーク対応はまだ整備途中
- 能力次元の客観的な差:速度優勢を推論能力の優勢と直接イコールで結ぶことはできず、複雑推論や長いチェーンを持つAgentタスクでの実際の効果は、まずChat入口で自ら試すことをおすすめします
💡 ヒント:もしあなたのビジネスがスループット密集型(カスタマーサポート、一括生産、マルチAgent協調)なら、UltraSpeedのコストパフォーマンスは極めて魅力的です。中核ニーズが複雑推論なら、まずChat入口で数ラウンドのベンチマークを行ってから移行するかを判断しましょう。
関連記事

チャットのように CAD モデリング:浙江大学発オープンソース CADDesigner 実践ガイド
一文の入力やラフスケッチから CADDesigner が 3D モデルを自動生成。浙江大学がオープンソース化した LLM 駆動 CAD エージェントの使い方と注意点を解説します。

歌歌AI(GoGoAI):中国初のピュア中国語 AI 音楽モデルを実測解説
中国語の歌唱に特化して最適化され、シングルGPU 10秒で中国語曲を1曲生成。Douyin(抖音)や剪映など7つのプラットフォームに接続済みの歌歌AI について、モデル能力・接続方法・クリエイターの収益化経路を解説します。

HuggingFace ランキングを制した MemSlides:あなたの好みを覚えてくれる PPT Agent
清華大学・上海交通大学・北京郵電大学の共同オープンソース MemSlides は、記憶駆動の PPT 生成 Agent で、パーソナライズされたスタイルと複数回の部分修正に対応し、HuggingFace ランキングで首位を獲得しました。

ShotStream:マルチショット長編動画をリアルタイムに演出するオープンソースフレームワーク(ECCV 2026)
香港中文大学 MMLab と Kuaishou Kling が共同オープンソース化した ShotStream は、初のリアルタイムストリーミング型マルチショット長編動画生成フレームワークで、生成速度は約25倍に向上し、生成しながらのストーリー調整に対応します。

Volcengine Seedance 2.0 API 連携実践ガイド:申請から最初の動画生成まで
開発者向け Seedance 2.0 動画 API 連携ガイド。Ark プラットフォームの有効化、API 呼び出し、SDK サンプル、TOS ストレージ、料金面の注意点を網羅します。

Claude Artifacts がついに公開共有+複数人リアルタイム編集に対応
Anthropic が Artifacts に公開リンク共有と複数人による同時編集(multiplayer)を追加。この機能の正体、使い方、そして Claude Code Artifacts との違いを解説します。