Skip to content

认识 MiMo-V2.6:小米把训练过程直播给你看,然后抢了开源第一

9 月 17 日凌晨,小米的罗福莉往社交媒体上挂了两个实时看板。

不是宣传海报,是训练数据看板——从此刻起,全世界可以盯着小米这两款模型的强化学习训练曲线看:通过率、轨迹数、每一步烧掉多少钱。

两轮训练,平均每小时烧掉 3.08 万美元

我承认我看到这个数字的第一反应是:这是一家手机公司该干的事吗?把一个还没发布的模型的训练过程,原原本本地直播出来,包括它卡住、掉点、恢复的全过程。

六天后,也就是 2026 年 9 月 22 日,小米发布并开源了这套模型——Xiaomi MiMo-V2.6 系列

然后它拿到了 Artificial Analysis 智能指数 46 分,力压 GLM-5.3(45)和 Kimi K3(44),成为该榜单上分数最高的开源权重模型

还是那句话:一个做手机、做汽车、做充电宝的公司,把开源大模型第一给拿走了。

什么是 MiMo-V2.6

MiMo-V2.6 是小米于 2026 年 9 月 22 日发布并开源的新一代原生全模态大模型系列,包含旗舰的 MiMo-V2.6-Pro 与高性价比的 MiMo-V2.6-Flash 两款模型,均为稀疏 MoE 架构,支持文本、图像、视频、音频四模态输入与 1M token 上下文,权重以 MIT 协议发布在 Hugging Face,可自由商用。

先把规格摆清楚(以下均为官方模型卡口径):

项目MiMo-V2.6-ProMiMo-V2.6-Flash
架构稀疏 MoE,总参数 1.02T / 激活 42B稀疏 MoE,总参数 309B / 激活 15B
激活比例4.1%4.9%
上下文1M tokens1M tokens
输入模态文本 / 图像 / 视频 / 音频文本 / 图像 / 视频 / 音频
输出文本文本
主干70 层,60 层滑窗注意力 + 10 层全局注意力同架构族
专家384 个路由专家,每 token 激活 8 个
视觉681M 参数 MiMo ViT
音频308M AudioTokenizer + 127M audio patch encoder
解码5 层 MTP 投机解码,一次前向预测 7 个 token
许可证MIT(可商用)MIT(可商用)

注意"原生全模态"这四个字。现在市面上很多模型的多模态是"后接一个视觉编码器",而 MiMo-V2.6 从架构上就把文本、图像、视频、音频塞进了同一个主干——音频是这次新增的,上一代没有。

还有一个容易被忽略的细节:**5 层 MTP 投机解码,一次前向预测 7 个 token。**这玩意儿不提升智能,只提升吐字速度,直接影响你等答案的体感。后面讲 UltraSpeed 时会再提到它。

顺手提一句参数口径的坑:Hugging Face 页面上有个"model size"标签,那个是下载体积口径,和官方的 1.02T 总参数不是一回事。 比较参数量时请以模型卡写的 1.02T / 42B 为准,别拿下载标签去跟别人比大小。

它有什么特点

  • 万亿参数,只醒 4.1%。 1.02T 决定能力上限,42B 决定单次推理成本。**能力按万亿模型算,账单按 400 亿模型付。**这个套路大家都在用,但小米这次把它和极致定价绑在了一起。

  • Artificial Analysis 智能指数 46 分,开源权重第一。 版本是 v4.3.2,由 10 项评测合成(含 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam)。小米公告里给的是 46.32 分这是第三方实测,不是厂商自报,可信度高一档。

    但要马上泼一盆冷水:**Grok 4.7 (xhigh) 也是 46 分。**AA 自己的表述是"MiMo-V2.6-Pro 和 GLM-5.3 (max) 是当前智能水平最高的开源模型"——46 和 45 之间,隔着的是测量误差,不是代际。

    "开源第一"这个标题,准确的表述应该是:在 Artificial Analysis 这一个榜单的这一个版本上,暂时第一。 它不是"全球最强模型"。离 Claude Fable 5.1、GPT-6 Astra 这些闭源前沿,仍然有肉眼可见的距离。

  • 性价比才是它真正想打的牌。 AA 给出的数字是:每个 Intelligence Index 任务约 $0.13,跑完整套评测花了 $206.66。小米自己的说法是同等智能水平下价格约为海外模型的 1/20 到 1/60,有网友拿它和 Grok 4.7 对比,结论是同等智能下 Grok 4.7 大约贵 29 倍。AA 把它放在智能—成本帕累托前沿上。

    定价维持 V2.5 不变(人民币口径):

    模型输入(缓存命中)输入(未命中)输出
    MiMo-V2.6-Pro0.025 元/百万3 元/百万6 元/百万
    MiMo-V2.6-Flash0.02 元/百万1 元/百万2 元/百万
    MiMo-V2.6-Pro-UltraSpeedPro 的 10 倍

    缓存命中相当于打了 99% 以上的折扣——对反复读同一份长上下文的负载(代码库检索、长文档问答),这个折扣是决定性的。

  • UltraSpeed:快 20 倍,贵 10 倍。 小米同步推出 MiMo-V2.6-Pro-UltraSpeed,官方称同等智力水平下输出速度最高提升 20 倍。AA 实测标准 Pro 是 129.7 output tokens/s、首 token 延迟 2.17 秒;UltraSpeed 定价是 Pro 的 10 倍($4.35 / $8.70 per MTok)。

    快 20 倍收 10 倍的钱,这笔账是划算的。 但它本质上是一个延迟档位,不是一个更聪明的模型——别为了"更快"多付 10 倍的钱去跑批处理任务。

  • 这次最不一样的地方:训练过程是直播的。 6 天,30 个 RL step,约 75 万条轨迹。Flash 花了约 85 万美元,Pro 花了约 262 万美元。每个 step:1568 个 prompt × 16 次 rollout,单步消耗 35 亿到 37 亿 token,训练上下文长度最高拉到 1M

    在 held-out 的 DeepSWE v1.1 上,Flash 从 48.8 → 65.68,Pro 从 58.4 → 72.57。训练任务平均通过率分别相对提升 25%12%

    把这些数据公开出来,比发一篇论文有诚意得多——因为它同时公开了成本。262 万美元,这个数字让所有人都能算:一次大规模 RL 到底贵在哪。

  • 四种 RL 方法,全都写在模型卡里。 这套命名很整齐,值得记住:

    方法全称干什么
    GRPOGroup Relative Policy Optimization全异步大批量:1568 prompts × 16 rollouts,组内归一化算优势,不需要 critic 网络
    GRSGroupwise Reward Synthesis离线对比不同 rollout,为具体任务合成评分标准(rubric),而不是套一个通用打分器
    GARGroupwise Advantage Redistribution在线给"通过了的轨迹"排序,把优势往更优解倾斜
    MOPD2Multi-Prefix Multi-Teacher On-Policy DistillationRL 之后的蒸馏阶段,学生自主 rollout 混合教师 prefix

    工程细节也交底了:冻结 MoE Router 以减少训练漂移;针对 reward hacking 设了奖励设计、对抗评估、异常检测、验证器交叉校验四层防护;统一了轨迹表示与惩罚机制。

    罗福莉的原话是,MiMo-V2.6 押注大规模 RL 扩展,团队把它视为探索 RSI(递归自我改进)、通往 AGI 的新一步,并直言其创新和工程难度已经超过了 DeepSeek R1

    这话听着很大,但你得承认:当一家公司愿意把训练成本、奖励设计和失败防护全部摊在桌面上时,"难不难"这件事变得可以被检验了。 反过来说,如果只发一个分数而不发这些,那才叫营销。

  • 开源的不只是权重。 这次一起放出来的有:基于 verl 的 RL 训练框架、7000+ 个分类训练环境(覆盖软件开发、漏洞复现、智力劳动、网页设计)、完整技术报告,以及一个 MiMo-V2.6-Distill-Qwen-9B(在 Qwen3.5-9B 上用 MiMo 生成数据做的 SFT,给社区做 RL 研究的起点)。

    7000 个环境这个数字,我认为是这次发布里对社区最有价值的东西。 权重会过时,但"可复现的 RL 环境"是基础设施。你想在自己垂类里复刻这套流程,缺的从来不是模型,是环境。

  • 能力边界也要看清楚,官方表里输的地方不少。 小米自己贴的表(DeepSWE v1.1):Pro 71.9、Flash 67.9,对比 DeepSeek V4.1 Flash 74.2、Claude Opus 5 74.0、GPT-6 Astra 74.0——是接近,不是超越。GDPval 2.1(Elo)Pro 1673,落后 Claude Fable 5.1(1735)和 Claude Opus 5(1708)。

    其他:Toolathlon-verified 76.9、Automation Bench v1.0.6 53.1Terminal Bench 4.0 仅 34.9、CyberGym Pro 94.0 / Flash 95.1(GLM-5.3 为 84.5)。

    **Terminal Bench 4.0 的 34.9 是个真问题。**这个基准测的正是"在终端里反复试错直到搞定",是 Coding Agent 烧预算最狠的地方。安全类评测则明显分裂——CyberGym 很强,但 ExploitGym / ExploitBench / SEC Bench Pro 落后于 Claude / GPT 系列。

  • 第三方实测也挑出了毛病。 智东西在 OpenCode 里上手测了一轮:多模态和编程水平"尚可",但存在长时间思考、反复查找目录文件的问题;有开发者反馈 Flash 在 OpenCode 中会不断循环执行命令和读取文件。让 Flash 做小米汽车官网 Demo,页面质量不错、交互流畅,结果搜索嵌进去的图片是奔驰、宝马、奥迪。让 Pro 写赛车游戏,花了 64 分钟,赛道不清晰、初始建模还埋在地下。

    那张"图片是奔驰宝马奥迪"的截图,我会记很久。 它说明的不是模型不会写代码,而是它没有"我是谁"这个约束——这类问题靠 RL 提分是提不上去的,得靠产品层补。

用在哪儿

3D 与游戏内容生成。 给它一段视频、一张图或一句话,它能自己拆任务、协调多个 Agent 搭 3D 场景、实现交互逻辑,并根据渲染结果做视觉检查和迭代。在 Blender 里可以按文本或参考图生成 3D 资产,进而用于动画、3D 打印和游戏开发。

Computer Use 与具身控制。 这是我觉得最骚的一个 demo:模型接收多视角相机画面,持续推理决策,再通过视觉反馈控制 Franka Panda 机械臂,完成物体抓取、颜色匹配和精确放置。模型不再只是"生成文本",而是接进了一个闭环

设计与前端。 能产出带版式结构、组件、交互元素和动效的完整前端界面或演示文稿,并可与 Figma 及图像、视频生成工具配合。

视频与音乐。 小米展示的一支产品宣传片,从视觉设计、镜头与动效编排,到音乐创作和卡点剪辑,全部由模型完成。音乐是这代新增能力——官方称强化了音乐理解、审美判断和乐理运用,demo 里有一首叫 Night Road 的管弦乐作品,模型自己完成作曲并转成 MIDI。

科研:这次最硬的两个案例,而且官方明说没有专门做过科研 RL 训练。

  • 材料科学:小米让 MiMo-V2.6-Pro 设计一种用于吸附 PFAS(全氟和多氟烷基物质) 的全新金属有机框架(MOF)。在材料专家引导下,模型完成网络检索、文献与专利梳理、提出假设与新颖性评估,再调用开源计算工具搭建仿真环境、计算 MOF 与 PFAS 的结合强度,最终筛选出三种候选框架,交由湿实验验证。这项能力已经用在小米内部的新材料研发里。
  • 数学:对 Li 与 Yorke 经典论文《周期三蕴含混沌》的主定理做 Lean 4 形式化。研究者设计探索策略后,模型通过 subagent 协作推进定理陈述与证明,最终项目包含 6000 多行 Lean 代码通过 Lean 内核完整验证,且没有留下未完成的证明占位符——而模型没有接受过任何 Lean 专项后训练。

6000 行 Lean 代码通过内核验证,没有 sorry 占位符,这件事的含金量比榜单分数高。 因为 Lean 内核是唯一一个不会给你面子的评委:过就是过,不过就是不过,没有"大致正确"这回事。 这种可机器验证的任务,正是大规模 RL 最理想的训练场——这也解释了小米为什么敢把 RL 算力堆到这个量级。

不适合的场景也说清楚:追求极致交付效率的短周期工程任务(实测会"长考"、爱翻目录)、终端重度试错类 Agent(Terminal Bench 4.0 只有 34.9)、以及你现在就想在一台机器上自托管——1.02T 参数的 MoE,权重体积不是闹着玩的。

初体验

三条路,从最省事到最硬核。

第一条,零代码。 直接用 MiMo Desktop(这次同步结束早期访问、发布正式版,Pro 和 Flash 内置,也支持填自己的 API Key)、AI StudioMiMo Code。想先看效果不想折腾,走这条。

第二条,走 API。 OpenRouter 已经上架,模型 ID 已经确认存在(上下文均为 1048576):

OpenRouter model ID说明
xiaomi/mimo-v2.6-pro旗舰
xiaomi/mimo-v2.6-flash高性价比
xiaomi/mimo-v2.6-pro-ultraspeed20 倍速档
python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_OPENROUTER_API_KEY",
    base_url="https://openrouter.ai/api/v1",
)

resp = client.chat.completions.create(
    model="xiaomi/mimo-v2.6-flash",   # 或 xiaomi/mimo-v2.6-pro
    messages=[
        {"role": "user", "content": "看一下这张架构图,指出三个最可能的性能瓶颈。"}
    ],
)
print(resp.choices[0].message.content)

第三条,自托管。 权重在 Hugging Face(同时上架 ModelScope):

bash
# 仓库名
XiaomiMiMo/MiMo-V2.6-Pro-RL        # 旗舰,MIT
XiaomiMiMo/MiMo-V2.6-Flash-RL      # 高性价比,MIT
XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B   # 9B 蒸馏版,做 RL 研究的起点

想亲手跑 RL 实验的话,小米把基于 verl 的训练框架和 7000+ 环境一起开源了,Distill-Qwen-9B 就是给你当起点的。

四个坑,提前说:

一是参数量决定硬件。Pro 是 1.02T 的 MoE,Flash 是 309B——这不是"两张 4090 就能跑"的东西。真想本地玩,从 Distill-Qwen-9B 入手,那才是给你准备的玩具。

二是别把 HF 的下载体积标签当参数量(前面说过)。

三是 Flash 在 Agent 场景会打转。第三方实测提到它在 OpenCode 里循环执行命令、读文件。如果你要接 Agent,先用你自己的任务集跑一遍,别直接上生产。

四是 UltraSpeed 是延迟档位,不是更强的模型。快 20 倍、贵 10 倍,只在对延迟敏感的场景才划算。

进阶

如果这篇文章你只记住一件事,我希望是这个判断:

MiMo-V2.6 真正的亮点不是"开源第一",而是它把"大规模 RL 到底怎么做的"变成了一份可复现的公开材料。

榜单第一这个位子,下周可能就换人——46 分和 45 分之间的距离,扛不住任何一次榜单改版。但7000 个训练环境、基于 verl 的 RL 框架、30 步训练的每一步成本、以及四层 reward hacking 防护,这些是留下来能用的东西。行业里大家都在说"RL scaling",但愿意把账单和失败防护一起交出来的,没几家。

冷水照例要泼,而且这次要泼在点上:

**46.32 分是第三方实测没错,但"开源第一"只在 AA 这一个榜单的 v4.3.2 版本上成立,且和 Grok 4.7 同分。**小米自己贴的对比表里,DeepSWE v1.1 的 71.9 落后于 DeepSeek V4.1 Flash(74.2)、Claude Opus 5(74.0)、GPT-6 Astra(74.0)——是"接近前沿",不是"超过前沿"。

**Terminal Bench 4.0 的 34.9 才是更要紧的短板。**终端试错是 Coding Agent 的真实主战场,这个分数意味着它在最烧钱的地方效率不占优。单位价格便宜,和单位任务便宜,从来不是一回事。

我的建议很具体:**先用 Flash 跑一批你自己的真实任务(尤其是带工具调用的长程任务),重点看两件事——一个任务总共走了多少步、以及它会不会在同一个目录里反复打转。**这两件事决定它值不值那个价,比任何榜单分数都准。

再往深一层,我强烈建议你去读那份技术报告里的训练基础设施部分:为什么大规模 RL 必须全异步、为什么要冻结 MoE Router、为什么奖励信号要靠"组内对比"而不是绝对打分。这三个问题,是 2026 年所有做 Agent 后训练的团队都在踩的坑——小米把答案写出来了,还把账单贴上了。

至于"RSI / 递归自我改进"这条路线走不走得通,我的看法是:**现在下结论都太早。**但至少这一次,小米给的不是一句口号,是一堆可以自己跑一遍的东西。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区