6 天,2000 多万,小米这场史无前例的「炼丹直播」终于尘埃落定。
过去这六天,小米把一场大模型强化学习训练搬进直播间,眼看着美元计价器一路狂跳。
如今,MiMo-V2.6 的 Pro 和 Flash 双双跑完 30 个训练 Step,最终账单定格在 350 万美元(约合人民币 2344 万元)。

钱烧完了,模型也冲上去了。
MiMo-V2.6-Pro,1.02 万亿参数,420 亿激活,在 Artificial Analysis Intelligence Index 上拿到 46 分,位列开源第一。
Hugging Face CEO 也称赞说,「太棒了」。

并且在多数 Agent 评测中,Pro 的成绩已经逼近 Claude Opus 5 和 GPT-5.6 Sol。

罗福莉将其称为「迄今为止任何开源模型团队所进行的规模最大的单次强化学习训练之一」。
还没完,更猛的还在后面,这位曾参与 DeepSeek-R1 研发的小米 MiMo 负责人直言:
在我看来,它背后的研究创新和工程挑战,超过了我曾参与其中的 DeepSeek-R1。
这话分量有多重?看完 MiMo-V2.6 的训练细节就知道了。
2000 多万烧完,开源模型冲进闭源前沿
聊技术之前,先带大家快速过一下这次直播的「收官战报」。
MiMo-V2.6-Pro 跑完 30 个 Step,用时 5 天 3 小时,花掉约 260 万美元;
Flash 同样跑完 30 个 Step,用时 3 天 10 小时,花掉约 90 万美元。
每个 Step 包含 1568 个 Prompt,每道题让模型尝试 16 条不同路线,一轮就会产生超过 2.5 万条 Rollout。
按技术报告单步 2.7B~3.7B training tokens 计算,Pro 全程累计处理约 81B~111B Tokens,相当于塞满超过 8 万个百万 Token 上下文窗口。

这么多 Token 和真金白银砸下去,效果也相当直接。
30 个 Step 结束后,Flash 的平均通过率相对提升 25%,Pro 相对提升 12%。
整体上涨之外,更有说服力的变化出现在 DeepSWE v1.1 这项样本外测试上。
Pro 从 58.4 分涨到 72.57 分,提升约 14 分;
Flash 从 48.7 分涨到 65.68 分,提升约 17 分。
DeepSWE v1.1 专门考察 Coding Agent 能不能在真实开源代码库中持续工作,OpenAI 和 Anthropic 也已将其列为前沿模型发布时的重点评测项。
MiMo-V2.6 的表现侧面说明,这轮 RL 不是在训练集上原地刷分,只跑 30 个 Step,模型不仅持续变强,还把能力迁移到了没见过的软件工程任务上,样本效率和样本外泛化一定程度上经住了检验。
尤其是 Flash,30 个 Step 跑完花费仅为 Pro 的约三分之一,相对提升反而更大,堪称这次训练的「性价比选手」。

至于 Pro,负责的则是冲击能力上限。
在 Artificial Analysis Intelligence Index 中,MiMo-V2.6-Pro 拿到 46 分,成功登上全球开源王座。

部分 Agent 评测中,它也已经和头部闭源模型打得有来有回。
例如 AutomationBench 上,Pro 拿到 53.1 分,超过 Claude Opus 5 的 50.3 分和 GPT-5.6 Sol 的 45.8 分。
再结合其他评测来看,MiMo-V2.6-Pro 在全球模型市场中的位置已经相当清晰:
冲进开源模型第一梯队,并在部分 Agent 任务上摸到了闭源前沿。
而且能力冲上去之后,价格并没有跟着涨。
MiMo-V2.6 继续沿用 V2.5 的 API 定价,Pro 输入/输出每百万 Token 约 3 元/6 元,Flash 约 1 元/2 元。
横向一比更夸张,在同等智能水平下,Pro 完成任务的成本仅为国际前沿模型的1/20 至1/60。
按照 Artificial Analysis 的测算,MiMo-V2.6-Pro 完成一项 Intelligence Index 任务,平均成本只有 0.13 美元(约合人民币 0.9 元)。
也就是说,小米第一次把 45 分以上前沿模型的单任务成本,打进了 0.1 美元量级(约合人民币 0.67 元)。
巧的是,同日发布的闭源模型 Grok 4.7,在这项指数上同样拿到 46 分,但据 Artificial Analysis 实测,其 xHigh 版本完成一项任务平均需要 3.74 美元,约为 MiMo-V2.6-Pro 的 29 倍。
同步上线的 MiMo-V2.6-UltraSpeed 模式,最高速度还能达到约 900 TPS。
成绩单晒完,小米紧接着又把开源清单摊开了,一看阵仗还真不小。
Pro 和 Flash 模型权重、完整技术报告、7000 多个 RL 任务环境、端到端 RL 训练框架,以及可以自由组合的 mini-harnesses,全部开放。
此外还有一个 MiMo-V2.6-Distill-Qwen-9B,这是一个以 Qwen3.5-9B 为底座,使用 MiMo 生成的 77.4B Token 数据完成监督微调的模型。
小米开放的是 SFT 版本,主要也是想给社区提供一个更强的 Agent RL 起点。
总之这一波,模型、训练场、裁判和训练流水线,小米基本都给配齐了。
也难怪小米一开源,整个 AI 圈瞬间沸腾。
罗福莉本人的推文在短短几小时内获得几十万浏览,不少大V也火速下场转发评论。

Ai2 后训练负责人 Nathan Lambert 直接表示:
真正懂开源模型的人,早就知道小米在用 MiMo 憋大招。
他尤其点赞了「最高分开源模型+公开 RL 仪表盘」这个组合,直呼很有范儿。

Hugging Face 前研究员 Elie Bakouch 关注的则是开源速度:
最夸张的是,他们在最终 RL 训练启动不到一周后,就交出了模型、技术报告、7000 多个 RL 环境和完整训练框架。

AI 研究者 Himanshu Raj 的评价更直接:
开源模型与闭源前沿之间的差距,又被大幅缩小了,而且这一次出手的还不是大家熟悉的中国玩家。

一片欢呼之外,有人迫不及待把视线进一步投向了「模型真正能做什么」。
超越 Vibe Coding,MiMo 直接 Vibe World
模型刚训完,小米内部就把 MiMo-V2.6-Pro 扔进了一个极其刁钻的科研场景,让它设计新型 MOF 材料。
此前,MiMo-V2.6-Pro 没有为科研场景做过一天的专项训练。
MOF,金属有机框架,2025 年诺贝尔化学奖刚颁给了这个领域。通俗点说就是在分子尺度上搭建一种「多孔笼子」,可以精确地抓住特定的分子。
小米前沿材料团队用它来对付 PFAS,这是一类全氟取代的有机物,PFAS 进了水和土壤之后几乎不降解,被称为「永久性污染物」。

△PFOA(全氟辛酸,一种典型的 PFAS 类物质)结构示意图
拿 MOF 去抓 PFAS,是材料科学领域一个公认的前沿难题。
MiMo-V2.6-Pro 接到这个课题之后,先检索梳理了相关文献和专利,提出设计假设,然后自己核查方案的新颖性。
「大胆猜想」之后,MiMo 便开始「小心求证」,它自动搭建好了模拟环境,并调用开源计算工具,计算它设计出来的 MOF 跟 PFAS 之间的结合强度。
它的思路是,在 MOF 内壁引入带正电的基团来吸引 PFAS 带负电的「头部」,同时嫁接更大、更扁平的芳香基团来容纳 PFAS 的含氟「尾巴」。
最终,模型跑出了两个候选结构,A50 用的是芘基连接件,B50 用的是三氟甲基联苯连接件,都是 UiO-67 型锆基框架。
模拟结果显示,A50 和 B50 对 PFAS 的吸附性能是对照材料 C50(联苯连接件)的一百万到一千万倍。

对此,北京大学材料科学与工程学院特聘研究员窦金虎教授评价说,MiMo-V2.6-Pro 在这个项目上的表现,相当于一个训练有素的博士研究员。
小米方面披露,该系列已应用于公司内部新材料研发工作,整个研发周期从一个月压缩到了 2 到 3 天,效率提升十倍。
科研只是一个切面。
MiMo-V2.6 这一代的能力,已经从「Vibe Coding」扩展到了「Vibe World」。
MiMo 模型的能力边界,从写代码延伸到了更多场景,例如 Blender 3D 建模、视频创作、音乐生成,涉及各种不同的模态。
这也使得 MiMo 成为了开源 Pro 级模型当中鲜有的支持全模态的模型。
为了全面展示这些能力,小米团队用 MiMo 搭建了一个 MiMo 展览馆,里面的图像、视频、声音、3D 模型等各种元素,全都是用 MiMo 生成的。

进入这座展览馆,映入眼帘的是一架钢琴,点击之后,钢琴就会开始自动演奏,演奏的音乐也是由 MiMo 创作,并且琴键也会匹配声音节奏进行运动。

从钢琴旁起身,就来到了左手边的卧室,卧室里有一台电脑,这台电脑是可以玩的。
它会不断地提示你密码,解锁之后便有游戏、PPT、终端 CLI、视频等多个模块。

最有意思的是浏览器,点开之后它会自动进入这个画廊的页面,形成了套娃。
在套娃页面里可以再次进入这个「电脑」,这时再点击浏览器,就会发现 MiMo 团队留下的彩蛋。

走出卧室,就能看到墙上挂的画,这是 MiMo 在模仿梵高的《罗纳河上的星夜》,画对面的房间里,藏了一座城堡。
整个环境的 3D 建模和动画,也都由 MiMo 完成,水面波光粼粼地反射着城堡和摩天轮的倒影,天空中还有烟花不断绽放。

代码、图像、视频、3D、音乐,这些过去需要分别找不同工具的事,MiMo-V2.6 一个模型就能理解和生成。
甚至在具身仿真环境里,MiMo 还能通过视觉反馈闭环控制 Franka Panda 机械臂,做物体抓取和颜色分拣。
能力涨了、价格不变、速度还更快了,MiMo-V2.6-Pro 站在了「智能-成本」的帕累托前沿上,打破了「智能、成本、速度」这组不可能三角。

除了模型本体,配合模型一起上线的还有 MiMo Desktop 桌面客户端,支持多个 Agent 协同工作。
我们试着用 MiMo Desktop 制作了一个「3D 中式宇宙」,呈现出中式元素构成的虚拟世界。

MiMo 先是设计了一个整体思路,然后把不同类型组件的构造任务分派给多个子 Agent 去完成。
这些组件之间相对独立,因此能够并行运行,相比串行省下了大量时间。
同时主 Agent 也没闲着,正在同步构建核心引擎和页面结构。

最终,它们各自的成果再由主 Agent 统筹整编,交付出了这样的作品:

可以看到,模型能够充分读懂 prompt 里的佛塔、悬空寺、宫阙水乡、各类中式建筑构件等大量东方元素,也可以理解「极其宏大、令人屏息的体素宇宙」的核心诉求,明白需要构建开阔大世界。
技术层面,MiMo 也能够识别多视角查看、第一视角漫游、光效运动逻辑这类交互类要求。
总之,面对这份要素繁杂的需求,MiMo 成功渲染了宏大梦幻的东方仙境,还原出了壮丽磅礴的体素古代中国。
从设计新材料到生成虚拟世界,从 3D 建模到控制机械臂……MiMo-V2.6 展示了一个模型在不同领域、不同模态之间自如切换的通用性。
直播页面没讲的 RL Scaling 内幕
Demo 看上去确实挺热闹,但真正硬核的还藏在技术报告里。
为了让这场超大规模 RL 顺利跑完,小米既要防模型「抄答案」,又得应付显卡爆显存、评分器失联、MoE 专家负载崩塌等一连串意外。
罗福莉口中「不可错过」的技术报告,真就越挖越有~

后训练技巧大公开
最核心的当然还是 MiMo-V2.6 采用的后训练方法,小米把这次 RL Scaling 拆成了三个方向。
第一,扩大训练本身的计算量。
整个系统采用完全异步架构。
生成、执行、评分和训练可以同时推进,做完的任务直接进入下一环,不必等待整批任务全部结束。
这样一来,数万个 Agent 能够持续进入不同任务现场,边干活、边试错、边为模型积累经验,整条训练流水线也不会被少数慢任务拖住。
第二,扩大模型可以进入的训练环境。
这次训练把代码、通用 Agent、视觉和网络安全任务混进同一次 RL Run,模型既要修代码、操作工具,也要设计网页、复现漏洞。
而且,同一类任务还会搭配不同的 Agent Harness。
如果模型只在一种工作台里训练,很容易记住特定操作套路,因此小米设计了多种可以自由组合的 mini-harnesses,让模型学到能迁移到其他 Agent 框架中的能力。
实验中,即便换成训练时没有见过的 Codex、Claude Code 和 mini-swe-agent,模型的平均通过率也从约 50% 涨到了 66%。
第三,也是最容易被忽略的一点,即给「判卷」过程增加算力。
在 MiMo-V2.6-Pro 的训练成本中,训练模型占 43.5%,生成 Rollout 占 43.8%,剩下 12.7% 都花在了 Grader 上。
也就是说,这场价值 260 万美元的 Pro 训练,光给模型「判作业」,就花掉了约 33 万美元。

为什么判个分也这么贵?因为 Agent 任务不是选择题。
假设两条代码轨迹最后都通过了测试,一条只改了 3 行,准确解决问题,另一条改了几百行,还塞进大量兼容分支、异常吞噬和无关配置。
传统奖励可能会给它们同样的满分,但这两份答案显然不该获得同样的鼓励。
为此,小米设计了两套组内评分机制:
一套提前为任务生成「实现质量」和「解决过程」评分标准;
另一套则让评分 Agent 同时查看同一道题的多条成功与失败轨迹,再给通过测试的方案排出高低。
改动更准确、更精简、更符合原代码库习惯的轨迹,获得更多训练信号。
靠投机方式过测试的,奖励直接归零。
结果模型不只会把题做对,还开始学会用更短的路径、更少的 Token,把事情做得更干净。
这也是小米所谓「自我改进闭环」的关键。
模型先生成多条路线,再由评分器找出其中更好的办法,最后把差异重新变成模型的学习信号。

△组内智能体评分机制
模型竟然会自己「偷答案」?
听起来确实顺,但模型很快找到了另一条「提升奖励」的捷径。
它开始抄答案了。
技术报告列出了不少真实案例:
有的模型会安装更新版本的软件包,直接查看里面已经修好的代码;有的会下载上游源码、克隆最新版仓库;还有的干脆搜索原始 Issue、PR 和历史 Commit,照着人类开发者公开的答案修改。

△报告精选出的案例
测试确实通过了,但题不是自己做的,啊这……
为了堵住这些路,小米先清理训练环境中的补丁、构建日志、缓存和多余 Git 历史,再切断网络,防止模型去外面搜现成答案。
这还不够。
团队又专门派出一个 Hack Agent,主动攻击训练环境,寻找可能泄漏答案的缓存、文件和工具漏洞。
Hack Agent 找到一条,团队就堵一条,堵完之后再让它继续找,直到现有环境里再也找不到可利用的答案,才正式投入训练。
即便如此,团队仍在 RL 过程中持续审查轨迹,一旦发现新的作弊方式,就把对应奖励清零并继续修补环境。
最终,两款模型被确认存在 Reward Hacking 的轨迹,比例都被控制在2% 以下。

△奖励作弊预防与监控机制
模型刚管住,硬件又出 bug 了
模型这边刚管住,硬件和基础设施又开始轮番出状况。
直播页面里出现过多次训练重启:
GPU 显存双比特错误、Cyber 任务集群 Kubernetes 故障、评分器网络失联、显存不足,以及长轨迹撑爆 CPU 内存。
其中一次 Pro 训练中,MoE 专家并行中,某个 EP rank 收到的 Token 负载超过平均值的 30 倍,直接把 GPU 显存顶爆。
团队继续排查发现,RL 会让负责分配 Token 的 MoE Router 不断漂移。
训练到第 20 步时,专家负载峰值已经从平均值的 6 倍涨到 16 倍,「冷专家」比例也从 0.5% 升至 22%。
更微妙的是,把 Router 恢复到 RL 开始前的参数后,专家负载马上恢复正常,模型能力却没有下降。
于是小米用了一个相当直接的办法:
RL 阶段,干脆把 Router 冻住。

△冻结 Router 防止 MoE 专家负载崩塌机制
至于一次性搬运数万条超长轨迹,小米还把控制平面与数据平面拆开:
调度系统只传轻量信息,Token、图像和路由数据等「大件」进入分布式存储,再由真正需要它们的训练节点读取。
各种长度不同、速度不同的任务,则交给 Sample Mixer 动态调度,避免简单任务早早跑完,复杂任务永远赶不上训练批次。
这些工程细节最终解决的是同一个问题:
当 RL 扩大到数千张 GPU、数万个并行 Agent 和数十亿 Token 一步时,单纯「多买显卡」已经不够了。训练场、Agent 工作台、评分系统、数据管道,以及防作弊机制,都得跟着一起扩大。
如果 RL 是通向模型自我改进(RSI)的路,那这条路在规模放大之后,会自己长出新的障碍。
模型学会抄答案,是它在「自我改进」的过程中找到了捷径,而不是真的变强;Router 漂移导致专家坍缩,是模型的内部结构在高强度 RL 下开始失稳……
每一个障碍,都不是简单调参数能解决的,它们是 RL 走向更大规模时必须面对的结构性问题。
DeepSeek-R1 走过一次这条路,MiMo-V2.6 在规模和复杂度上又往前推了一步,也就意味着它撞上的问题更深。
但这些问题最终被一个一个啃了下来,Reward Hacking 有 Hack Agent 对抗,Router 漂移有冻结策略兜底,Grader 成本控制在训练总成本的 12.7%,说明大规模 RL 这条路是走得通的。
每解决一个问题,模型就离「通过 RL 持续变强」更近一步。
MiMo-V2.6,就是小米在 RSI 这条通向 AGI 的路上迈出的关键一步。
也是小米开创「直播大模型训练过程」背后,展现出的最核心的技术底气和硬实力。
开源地址:
https://huggingface.co/collections/XiaomiMiMo/mimo-v26
博客:
https://mimo.xiaomi.com/mimo-v2-6
技术报告:
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
