toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI资讯
精选推文
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,360个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI资讯
  • 精选推文
  • 提交AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策

小米 MiMo-V2.5-Pro-UltraSpeed:1T 模型跑出 1000 tokens/s

2026/07/05
·toolin小编

小米旗舰极速推理模型,标准 8 卡通用 GPU 节点上突破 1000 tokens/s 输出,输出定价 18 元/百万 tokens

小米 MiMo-V2.5-Pro-UltraSpeed:1T 模型跑出 1000 tokens/s
小米 MiMo-V2.5-Pro-UltraSpeed:1T 模型跑出 1000 tokens/s
2026/07/05

小米 MiMo-V2.5-Pro-UltraSpeed:1T 模型跑出 1000 tokens/s

小米旗舰极速推理模型,标准 8 卡通用 GPU 节点上突破 1000 tokens/s 输出,输出定价 18 元/百万 tokens

MiMo-V2.5-Pro-UltraSpeed 是什么速度:行业坐标里的位置它怎么做到的:模型侧 + 系统侧协同优化模型侧系统侧定价:3 倍价格换 10 倍速度怎么申请使用应用场景争议与限制
AI产品
所有文章

作者

avatar for toolin小编
toolin小编

分类

  • AI产品
MiMo-V2.5-Pro-UltraSpeed 是什么速度:行业坐标里的位置它怎么做到的:模型侧 + 系统侧协同优化模型侧系统侧定价:3 倍价格换 10 倍速度怎么申请使用应用场景争议与限制

相关文章

Seko 无限画布实操:丢个灵感,Agent 帮你做完一整部 AI 视频
AI教程

Seko 无限画布实操:丢个灵感,Agent 帮你做完一整部 AI 视频

Seko 无限画布 + Seedance 2.0 实操指南,720P 成本直降 50%、1080P 直降 80%,小白也能 10 分钟做出多剧集 AI 视频大片。

avatar for toolin小编
toolin小编
3周前
微信小微内测实测:右滑一下,把整个微信变成 Agent
AI产品

微信小微内测实测:右滑一下,把整个微信变成 Agent

微信官方 AI 助手小微内测体验:聊天总结、自动回复、调小程序、转账、看朋友圈、开发小工具,八大能力一次看懂。

avatar for toolin小编
toolin小编
3周前
教育部「阳光志愿」AI 助手:免费生成志愿填报方案
AI产品

教育部「阳光志愿」AI 助手:免费生成志愿填报方案

教育部官方升级「阳光志愿」系统,AI 助手「智慧小招」24 小时在线,基于官方数据免费提供冲稳保志愿方案

avatar for toolin小编
toolin小编
3周前

小米 MiMo 团队与 AI 推理系统团队 TileRT 联合推出的 MiMo-V2.5-Pro-UltraSpeed 是一个"反常识"的模型。它把万亿参数(1T)MoE 模型放到一个标准 8 卡通用 GPU 节点上,输出速度首次突破 1000 tokens/s,峰值约 1200 tokens/s——而这个速度不依赖 Cerebras 晶圆级芯片或 Groq 定制 SRAM 等专用硬件。模型上线不到两周就收到超过 6.6 万个使用申请,原定 6 月 23 日结束的体验窗口被迫延长。这篇文章拆解它的技术路径、定价和申请方式,帮你看清它到底"快"在哪、值不值得用。

MiMo-V2.5-Pro-UltraSpeed 是什么

一句话定义:小米在通用硬件上跑出 1000 tokens/s 的万亿参数旗舰模型。

  • 架构:MoE(Mixture of Experts)
  • 总参数量:1T(万亿)
  • 激活参数:单次前向传播约 420 亿
  • 上下文长度:支持 100 万 token
  • 核心突破:8 卡通用 GPU 节点上稳定输出 1000 tokens/s,峰值约 1200 tokens/s

小米 MiMo 公告称申请量"远超预期",决定延长开放时间。

速度:行业坐标里的位置

把 1000 tokens/s 放在行业坐标中,冲击力非常明显。根据 AI 基准测试平台 Artificial Analysis 的数据:

模型输出速度(约)
GPT-5.562-68 tokens/s
Claude Opus71 tokens/s
Gemini Flash192-200 tokens/s
MiMo-V2.5-Pro-UltraSpeed1000-1200 tokens/s

这意味着 UltraSpeed 的输出速度比肩部前沿模型快一个数量级,对于实时对话、流式代码生成、长文批量生产这类对延迟敏感的场景,体验差异是质变级别的。

它怎么做到的:模型侧 + 系统侧协同优化

关键在于它没有依赖专用硬件,而是通过模型侧和系统侧协同优化榨取通用 GPU 的性能。

模型侧

  • FP4 混合量化:主要对 MoE Expert 做 FP4 量化,其他模块保留较高精度,降低模型体积和访存压力
  • DFlash 投机解码:用块级 Masked 并行预测替代传统 Draft 模型的逐 token 自回归,让大模型一次验证更多候选 token

Hugging Face 开源的 MiMo-V2.5-Pro-FP4-DFlash 模型卡是 UltraSpeed 背后的底层模型,包含 FP4 量化 backbone + BF16 DFlash drafter,许可证为 MIT。

系统侧

  • TileRT 为 FP4 量化和 DFlash 流程定制编译引擎与计算核
  • 通过常驻内核引擎、异构流水线协作减少算子启动和同步开销

定价:3 倍价格换 10 倍速度

UltraSpeed API 采用限时体验价,定价为标准版 MiMo-V2.5-Pro 的 3 倍,同时提供约 10 倍的输出速度提升。

计费项标准版 MiMo-V2.5-ProUltraSpeed
缓存命中输入0.025 元/百万 tokens标准版 3 倍
缓存未命中输入3 元/百万 tokens标准版 3 倍
输出6 元/百万 tokens18 元/百万 tokens(约 2.65 美元)

作为参照,Anthropic 旗舰 Claude Opus 公开定价为输入 5 美元/百万 tokens(约 34 元),输出 25 美元/百万 tokens(约 170 元)。UltraSpeed 输出价格仅为 Claude Opus 的约 1.5%,速度却快十几倍——当然,模型能力维度不能简单划等号,但这个性价比对吞吐密集型业务非常友好。

雷军在微博上发文宣布 MiMo-V2.5-Pro-UltraSpeed 的新进展。

怎么申请使用

目前模型仍在限时体验阶段,已审核通过的用户可继续使用,未申请的需要走内测申请:

  • API 申请入口:https://platform.xiaomimimo.com/ultraspeed
  • Chat 体验入口:https://ultraspeed.xiaomimimo.com
  • 开源底层模型:https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash(MIT 许可)

截至 6 月 23 日,已收到超过 6.6 万个使用申请,申请者包括世界 500 强公司、行业头部企业与个人开发者,覆盖法律、金融、通信、物流、汽车制造、文化传媒、高校等领域。

应用场景

1000 tokens/s 的速度解锁了一批原本"等不起"的场景:

  • 实时对话与客服:首 token 与流式输出延迟接近实时,用户体验质变
  • 流式代码生成:编码 Agent 的多轮迭代不再卡顿
  • 长文批量生产:报告、营销文案、知识库整理的吞吐量大幅提升
  • 多 Agent 协同:Agent 间高频调用对延迟敏感,极速输出显著降低总耗时
  • 教育与陪护:口语化、即时反馈的场景对响应速度要求极高

争议与限制

  • "万亿参数"的可比性:海外开发者社区有人质疑 MoE 架构下"万亿参数"与稠密模型的可比性,实际激活 420 亿参数的口径需要厘清
  • 生态成熟度:相比 Claude、GPT 等成熟生态,MiMo 的工具链、Agent 框架支持仍在补齐
  • 能力维度的客观差距:速度优势不能直接等同于推理能力优势,复杂推理、长链路 Agent 任务的实际效果建议先用 Chat 入口自测

💡 提示:如果你的业务是吞吐密集型(客服、批量生产、多 Agent 协同),UltraSpeed 的性价比极具吸引力;如果核心需求是复杂推理,建议先用 Chat 入口做几轮基准测试再决定是否迁移。