---
url: /lm/mimo-v26/introduction.md
description: >-
  MiMo-V2.6 是小米于 2026 年 9 月 22 日发布并开源的新一代原生全模态大模型系列，Pro 版稀疏 MoE 总参数 1.02 万亿、每
  token 仅激活 420 亿，支持文本/图像/视频/音频四模态输入与 1M 上下文，MIT 协议可商用。Artificial Analysis 智能指数
  v4.3.2 拿下 46 分（46.32），超过 GLM-5.3 与 Kimi K3 登顶开源权重第一；官方定价维持 V2.5 不变（Pro 3
  元/百万输入、6 元/百万输出）。最大看点不只是分数，而是小米把 6 天 30 步、75 万条轨迹的 RL 训练过程全程直播，并连同 RL 框架、7000+
  训练环境与技术报告一起开源。
---

# 认识 MiMo-V2.6：小米把训练过程直播给你看，然后抢了开源第一

9 月 17 日凌晨，小米的罗福莉往社交媒体上挂了两个实时看板。

不是宣传海报，是**训练数据看板**——从此刻起，全世界可以盯着小米这两款模型的强化学习训练曲线看：通过率、轨迹数、每一步烧掉多少钱。

两轮训练，**平均每小时烧掉 3.08 万美元**。

我承认我看到这个数字的第一反应是：这是一家手机公司该干的事吗？把一个还没发布的模型的训练过程，原原本本地直播出来，包括它卡住、掉点、恢复的全过程。

六天后，也就是 **2026 年 9 月 22 日**，小米发布并开源了这套模型——**Xiaomi MiMo-V2.6 系列**。

然后它拿到了 **Artificial Analysis 智能指数 46 分**，力压 GLM-5.3（45）和 Kimi K3（44），成为该榜单上**分数最高的开源权重模型**。

还是那句话：一个做手机、做汽车、做充电宝的公司，把开源大模型第一给拿走了。

## 什么是 MiMo-V2.6

**MiMo-V2.6 是小米于 2026 年 9 月 22 日发布并开源的新一代原生全模态大模型系列，包含旗舰的 MiMo-V2.6-Pro 与高性价比的 MiMo-V2.6-Flash 两款模型，均为稀疏 MoE 架构，支持文本、图像、视频、音频四模态输入与 1M token 上下文，权重以 MIT 协议发布在 Hugging Face，可自由商用。**

先把规格摆清楚（以下均为官方模型卡口径）：

| 项目 | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| 架构 | 稀疏 MoE，总参数 **1.02T** / 激活 **42B** | 稀疏 MoE，总参数 **309B** / 激活 **15B** |
| 激活比例 | 约 **4.1%** | 约 **4.9%** |
| 上下文 | 1M tokens | 1M tokens |
| 输入模态 | 文本 / 图像 / 视频 / **音频** | 文本 / 图像 / 视频 / **音频** |
| 输出 | 文本 | 文本 |
| 主干 | 70 层，60 层滑窗注意力 + 10 层全局注意力 | 同架构族 |
| 专家 | 384 个路由专家，每 token 激活 8 个 | — |
| 视觉 | 681M 参数 MiMo ViT | 同 |
| 音频 | 308M AudioTokenizer + 127M audio patch encoder | 同 |
| 解码 | 5 层 MTP 投机解码，一次前向预测 7 个 token | 同 |
| 许可证 | **MIT**（可商用） | **MIT**（可商用） |

注意"**原生全模态**"这四个字。现在市面上很多模型的多模态是"后接一个视觉编码器"，而 MiMo-V2.6 从架构上就把文本、图像、视频、音频塞进了同一个主干——**音频是这次新增的**，上一代没有。

还有一个容易被忽略的细节：\*\*5 层 MTP 投机解码，一次前向预测 7 个 token。\*\*这玩意儿不提升智能，只提升吐字速度，直接影响你等答案的体感。后面讲 UltraSpeed 时会再提到它。

> 顺手提一句参数口径的坑：Hugging Face 页面上有个"model size"标签，那个是**下载体积口径**，和官方的 1.02T 总参数不是一回事。
> 比较参数量时请以模型卡写的 **1.02T / 42B** 为准，别拿下载标签去跟别人比大小。

## 它有什么特点

* **万亿参数，只醒 4.1%。** 1.02T 决定能力上限，42B 决定单次推理成本。\*\*能力按万亿模型算，账单按 400 亿模型付。\*\*这个套路大家都在用，但小米这次把它和极致定价绑在了一起。

* **Artificial Analysis 智能指数 46 分，开源权重第一。** 版本是 **v4.3.2**，由 10 项评测合成（含 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam）。小米公告里给的是 **46.32 分**。**这是第三方实测，不是厂商自报，可信度高一档。**

  但要马上泼一盆冷水：\*\*Grok 4.7 (xhigh) 也是 46 分。\*\*AA 自己的表述是"MiMo-V2.6-Pro 和 GLM-5.3 (max) 是当前智能水平最高的开源模型"——**46 和 45 之间，隔着的是测量误差，不是代际。**

  > "开源第一"这个标题，准确的表述应该是：**在 Artificial Analysis 这一个榜单的这一个版本上，暂时第一。**
  > 它不是"全球最强模型"。离 Claude Fable 5.1、GPT-6 Astra 这些闭源前沿，仍然有肉眼可见的距离。

* **性价比才是它真正想打的牌。** AA 给出的数字是：**每个 Intelligence Index 任务约 $0.13**，跑完整套评测花了 $206.66。小米自己的说法是同等智能水平下价格约为海外模型的 **1/20 到 1/60**，有网友拿它和 Grok 4.7 对比，结论是**同等智能下 Grok 4.7 大约贵 29 倍**。AA 把它放在**智能—成本帕累托前沿**上。

  定价维持 V2.5 不变（人民币口径）：

  | 模型 | 输入（缓存命中） | 输入（未命中） | 输出 |
  |---|---|---|---|
  | MiMo-V2.6-Pro | 0.025 元/百万 | 3 元/百万 | 6 元/百万 |
  | MiMo-V2.6-Flash | 0.02 元/百万 | 1 元/百万 | 2 元/百万 |
  | MiMo-V2.6-Pro-UltraSpeed | Pro 的 **10 倍** | — | — |

  缓存命中相当于**打了 99% 以上的折扣**——对反复读同一份长上下文的负载（代码库检索、长文档问答），这个折扣是决定性的。

* **UltraSpeed：快 20 倍，贵 10 倍。** 小米同步推出 MiMo-V2.6-Pro-UltraSpeed，官方称**同等智力水平下输出速度最高提升 20 倍**。AA 实测标准 Pro 是 **129.7 output tokens/s、首 token 延迟 2.17 秒**；UltraSpeed 定价是 Pro 的 10 倍（$4.35 / $8.70 per MTok）。

  > 快 20 倍收 10 倍的钱，这笔账是划算的。
  > 但它本质上是**一个延迟档位，不是一个更聪明的模型**——别为了"更快"多付 10 倍的钱去跑批处理任务。

* **这次最不一样的地方：训练过程是直播的。** 6 天，30 个 RL step，约 **75 万条轨迹**。Flash 花了约 **85 万美元**，Pro 花了约 **262 万美元**。每个 step：**1568 个 prompt × 16 次 rollout**，单步消耗 **35 亿到 37 亿 token**，训练上下文长度最高拉到 **1M**。

  在 held-out 的 DeepSWE v1.1 上，Flash 从 **48.8 → 65.68**，Pro 从 **58.4 → 72.57**。训练任务平均通过率分别相对提升 **25%** 和 **12%**。

  **把这些数据公开出来，比发一篇论文有诚意得多**——因为它同时公开了成本。262 万美元，这个数字让所有人都能算：一次大规模 RL 到底贵在哪。

* **四种 RL 方法，全都写在模型卡里。** 这套命名很整齐，值得记住：

  | 方法 | 全称 | 干什么 |
  |---|---|---|
  | **GRPO** | Group Relative Policy Optimization | 全异步大批量：1568 prompts × 16 rollouts，组内归一化算优势，**不需要 critic 网络** |
  | **GRS** | Groupwise Reward Synthesis | 离线对比不同 rollout，**为具体任务合成评分标准**（rubric），而不是套一个通用打分器 |
  | **GAR** | Groupwise Advantage Redistribution | 在线给"通过了的轨迹"排序，把优势往更优解倾斜 |
  | **MOPD2** | Multi-Prefix Multi-Teacher On-Policy Distillation | RL 之后的蒸馏阶段，学生自主 rollout 混合教师 prefix |

  工程细节也交底了：**冻结 MoE Router** 以减少训练漂移；针对 reward hacking 设了**奖励设计、对抗评估、异常检测、验证器交叉校验**四层防护；统一了轨迹表示与惩罚机制。

  罗福莉的原话是，MiMo-V2.6 押注大规模 RL 扩展，团队把它视为**探索 RSI（递归自我改进）、通往 AGI 的新一步**，并直言**其创新和工程难度已经超过了 DeepSeek R1**。

  > 这话听着很大，但你得承认：**当一家公司愿意把训练成本、奖励设计和失败防护全部摊在桌面上时，"难不难"这件事变得可以被检验了。**
  > 反过来说，如果只发一个分数而不发这些，那才叫营销。

* **开源的不只是权重。** 这次一起放出来的有：基于 **verl** 的 RL 训练框架、**7000+ 个分类训练环境**（覆盖软件开发、漏洞复现、智力劳动、网页设计）、完整技术报告，以及一个 **MiMo-V2.6-Distill-Qwen-9B**（在 Qwen3.5-9B 上用 MiMo 生成数据做的 SFT，给社区做 RL 研究的起点）。

  > 7000 个环境这个数字，我认为是这次发布里**对社区最有价值的东西**。
  > 权重会过时，但"可复现的 RL 环境"是基础设施。你想在自己垂类里复刻这套流程，缺的从来不是模型，是环境。

* **能力边界也要看清楚，官方表里输的地方不少。** 小米自己贴的表（DeepSWE v1.1）：Pro **71.9**、Flash **67.9**，对比 DeepSeek V4.1 Flash **74.2**、Claude Opus 5 **74.0**、GPT-6 Astra **74.0**——**是接近，不是超越**。GDPval 2.1（Elo）Pro **1673**，落后 Claude Fable 5.1（1735）和 Claude Opus 5（1708）。

  其他：Toolathlon-verified **76.9**、Automation Bench v1.0.6 **53.1**、**Terminal Bench 4.0 仅 34.9**、CyberGym Pro **94.0** / Flash **95.1**（GLM-5.3 为 84.5）。

  \*\*Terminal Bench 4.0 的 34.9 是个真问题。\*\*这个基准测的正是"在终端里反复试错直到搞定"，是 Coding Agent 烧预算最狠的地方。安全类评测则明显分裂——CyberGym 很强，但 ExploitGym / ExploitBench / SEC Bench Pro 落后于 Claude / GPT 系列。

* **第三方实测也挑出了毛病。** 智东西在 OpenCode 里上手测了一轮：多模态和编程水平"尚可"，但**存在长时间思考、反复查找目录文件的问题**；有开发者反馈 Flash 在 OpenCode 中会**不断循环执行命令和读取文件**。让 Flash 做小米汽车官网 Demo，页面质量不错、交互流畅，结果**搜索嵌进去的图片是奔驰、宝马、奥迪**。让 Pro 写赛车游戏，花了 **64 分钟**，赛道不清晰、初始建模还埋在地下。

  > 那张"图片是奔驰宝马奥迪"的截图，我会记很久。
  > 它说明的不是模型不会写代码，而是**它没有"我是谁"这个约束**——这类问题靠 RL 提分是提不上去的，得靠产品层补。

## 用在哪儿

**3D 与游戏内容生成。** 给它一段视频、一张图或一句话，它能自己拆任务、协调多个 Agent 搭 3D 场景、实现交互逻辑，并根据渲染结果做视觉检查和迭代。在 Blender 里可以按文本或参考图生成 3D 资产，进而用于动画、3D 打印和游戏开发。

**Computer Use 与具身控制。** 这是我觉得最骚的一个 demo：模型接收**多视角相机画面**，持续推理决策，再通过视觉反馈控制 **Franka Panda 机械臂**，完成物体抓取、颜色匹配和精确放置。模型不再只是"生成文本"，而是**接进了一个闭环**。

**设计与前端。** 能产出带版式结构、组件、交互元素和动效的完整前端界面或演示文稿，并可与 Figma 及图像、视频生成工具配合。

**视频与音乐。** 小米展示的一支产品宣传片，从视觉设计、镜头与动效编排，到音乐创作和卡点剪辑，全部由模型完成。音乐是这代新增能力——官方称强化了音乐理解、审美判断和乐理运用，demo 里有一首叫 **Night Road** 的管弦乐作品，模型自己完成作曲并转成 MIDI。

**科研：这次最硬的两个案例，而且官方明说没有专门做过科研 RL 训练。**

* **材料科学**：小米让 MiMo-V2.6-Pro 设计一种用于吸附 **PFAS（全氟和多氟烷基物质）** 的全新金属有机框架（MOF）。在材料专家引导下，模型完成网络检索、文献与专利梳理、提出假设与新颖性评估，再调用开源计算工具搭建仿真环境、计算 MOF 与 PFAS 的结合强度，最终**筛选出三种候选框架**，交由湿实验验证。这项能力已经用在小米内部的新材料研发里。
* **数学**：对 Li 与 Yorke 经典论文《周期三蕴含混沌》的主定理做 **Lean 4 形式化**。研究者设计探索策略后，模型通过 subagent 协作推进定理陈述与证明，最终项目包含 **6000 多行 Lean 代码**，**通过 Lean 内核完整验证，且没有留下未完成的证明占位符**——而模型没有接受过任何 Lean 专项后训练。

> 6000 行 Lean 代码通过内核验证，没有 `sorry` 占位符，这件事的含金量比榜单分数高。
> 因为 Lean 内核是**唯一一个不会给你面子的评委**：过就是过，不过就是不过，没有"大致正确"这回事。
> 这种**可机器验证的任务**，正是大规模 RL 最理想的训练场——这也解释了小米为什么敢把 RL 算力堆到这个量级。

**不适合的场景也说清楚**：追求极致交付效率的短周期工程任务（实测会"长考"、爱翻目录）、终端重度试错类 Agent（Terminal Bench 4.0 只有 34.9）、以及**你现在就想在一台机器上自托管**——1.02T 参数的 MoE，权重体积不是闹着玩的。

## 初体验

三条路，从最省事到最硬核。

**第一条，零代码。** 直接用 **MiMo Desktop**（这次同步结束早期访问、发布正式版，Pro 和 Flash 内置，也支持填自己的 API Key）、**AI Studio** 或 **MiMo Code**。想先看效果不想折腾，走这条。

**第二条，走 API。** OpenRouter 已经上架，模型 ID 已经确认存在（上下文均为 1048576）：

| OpenRouter model ID | 说明 |
|---|---|
| `xiaomi/mimo-v2.6-pro` | 旗舰 |
| `xiaomi/mimo-v2.6-flash` | 高性价比 |
| `xiaomi/mimo-v2.6-pro-ultraspeed` | 20 倍速档 |

```python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_OPENROUTER_API_KEY",
    base_url="https://openrouter.ai/api/v1",
)

resp = client.chat.completions.create(
    model="xiaomi/mimo-v2.6-flash",   # 或 xiaomi/mimo-v2.6-pro
    messages=[
        {"role": "user", "content": "看一下这张架构图，指出三个最可能的性能瓶颈。"}
    ],
)
print(resp.choices[0].message.content)
```

**第三条，自托管。** 权重在 Hugging Face（同时上架 ModelScope）：

```bash
# 仓库名
XiaomiMiMo/MiMo-V2.6-Pro-RL        # 旗舰，MIT
XiaomiMiMo/MiMo-V2.6-Flash-RL      # 高性价比，MIT
XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B   # 9B 蒸馏版，做 RL 研究的起点
```

想亲手跑 RL 实验的话，小米把基于 **verl** 的训练框架和 **7000+ 环境**一起开源了，Distill-Qwen-9B 就是给你当起点的。

**四个坑，提前说：**

一是**参数量决定硬件**。Pro 是 1.02T 的 MoE，Flash 是 309B——**这不是"两张 4090 就能跑"的东西**。真想本地玩，从 **Distill-Qwen-9B** 入手，那才是给你准备的玩具。

二是**别把 HF 的下载体积标签当参数量**（前面说过）。

三是 **Flash 在 Agent 场景会打转**。第三方实测提到它在 OpenCode 里循环执行命令、读文件。**如果你要接 Agent，先用你自己的任务集跑一遍，别直接上生产。**

四是 **UltraSpeed 是延迟档位，不是更强的模型**。快 20 倍、贵 10 倍，只在对延迟敏感的场景才划算。

## 进阶

如果这篇文章你只记住一件事，我希望是这个判断：

**MiMo-V2.6 真正的亮点不是"开源第一"，而是它把"大规模 RL 到底怎么做的"变成了一份可复现的公开材料。**

榜单第一这个位子，下周可能就换人——46 分和 45 分之间的距离，扛不住任何一次榜单改版。但**7000 个训练环境、基于 verl 的 RL 框架、30 步训练的每一步成本、以及四层 reward hacking 防护**，这些是留下来能用的东西。行业里大家都在说"RL scaling"，但愿意把账单和失败防护一起交出来的，没几家。

冷水照例要泼，而且这次要泼在点上：

\*\*46.32 分是第三方实测没错，但"开源第一"只在 AA 这一个榜单的 v4.3.2 版本上成立，且和 Grok 4.7 同分。\*\*小米自己贴的对比表里，DeepSWE v1.1 的 71.9 落后于 DeepSeek V4.1 Flash（74.2）、Claude Opus 5（74.0）、GPT-6 Astra（74.0）——**是"接近前沿"，不是"超过前沿"。**

\*\*Terminal Bench 4.0 的 34.9 才是更要紧的短板。\*\*终端试错是 Coding Agent 的真实主战场，这个分数意味着它在最烧钱的地方效率不占优。**单位价格便宜，和单位任务便宜，从来不是一回事。**

我的建议很具体：\*\*先用 Flash 跑一批你自己的真实任务（尤其是带工具调用的长程任务），重点看两件事——一个任务总共走了多少步、以及它会不会在同一个目录里反复打转。\*\*这两件事决定它值不值那个价，比任何榜单分数都准。

再往深一层，我强烈建议你去读那份技术报告里的**训练基础设施部分**：为什么大规模 RL 必须全异步、为什么要冻结 MoE Router、为什么奖励信号要靠"组内对比"而不是绝对打分。**这三个问题，是 2026 年所有做 Agent 后训练的团队都在踩的坑**——小米把答案写出来了，还把账单贴上了。

至于"RSI / 递归自我改进"这条路线走不走得通，我的看法是：\*\*现在下结论都太早。\*\*但至少这一次，小米给的不是一句口号，是一堆可以自己跑一遍的东西。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
