21 世纪经济报道记者雷晨
9 月 22 日,小米正式发布并开源 MiMo-V2.6 系列,包含全模态旗舰 Pro 与高效推理 Flash,Pro 超高速模式 V2.6-Pro-Ultraspeed 同步上线,MiMoDesktop 桌面客户端正式版推出。
小米集团创始人雷军当日发布微博称,9 月 17 日起公开直播 MiMo-V2.6 强化学习后训练过程,六天直播背后是近半年基础研究和工程试错;此次保持模型架构和参数规模不变,通过扩大 RL 训练规模,提升编程、智能体、设计、研究等任务能力,API 定价不变。
据 Artificial Analysis 发布的综合智能指数,MiMo-V2.6-Pro 获 46 分,列全球开源模型第一、国产模型第一,超过 Kimi K3、Qwen3.8 Max,并首次支持文本、图片、视频、音频全模态,是全球开源阵容中唯一全模态 Pro 模型。单任务成本榜单显示,其实测单任务成本为 0.13 美元,首次进入 0.1 美元区间,API 定价沿用 V2.5,同等智能水平下价格仅为海外模型的1/20 至1/60。
烧钱规模同样直观:RL 后训练约 6 天,Flash 成本约 85 万美元,Pro 约 262 万美元,合计超 347 万美元,累计约 75 万条轨迹。长程软件工程评测中,Flash 得分从 48.8 升至 65.68,Pro 得分从 58.4 升至 72.57。
技术侧,小米采用大 Batch 与全异步架构,单次更新 1568 个样本,支持 1M 上下文训练,单步 Token 达 3.5-3.7B;混合多 Harness 框架,为 Long Horizon RL 提供更精准奖励信号;冻结 Router 抑制漂移,并建立覆盖奖励设计、对抗评测、异常检测与验证器交叉校验的 Reward Hacking 防线。
能力跃升体现在科研场景。Pro 以“Co-Scientist”角色协助材料团队设计 MOF 方案,吸附 PFAS,将约一个月的研发周期缩短至2—3 天,效率提升约 10 倍。它还在 Lean 4 中完成论文《周期三蕴含混沌》中的 Li-Yorke 定理主定理形式化,形成 6000 余行源码,全部通过内核核验,且此前未接受 Lean 专项后训练。Design Arena 评测中,其设计能力接近 Claude Opus 5 与 GPT-5.6 Sol。
开源力度是另一重点。小米除开放 Pro 和 Flash 权重外,还开源 RL 技术成果、MiMo-V2.6-Distill-Qwen-9B、7000 余个高质量任务环境、端到端 RL 训练框架与轻量化 Agent 框架。以 Distill-Qwen-9B 为起点进行 RL 训练,11 项评测全面提升:SWE-bench Verified 得分从 61.1 升至 66.2,MiMo Cyber Bench 从 31.3 升至 47.0,Terminal Bench 2.1 从 37.1 升至 52.8,MiMo Visual Coding 从 64.0 升至 72.4。
客观来看,这是一套“训练端重金投入、推理端低价输出、开源端全面释放”的组合。347 万美元只覆盖 RL 后训练,不含前期研发与推理成本;0.13 美元的单任务成本能否支撑商业闭环,开源能否转化为生态主导权,仍需观察。但小米至少把“后训练还能释放多大潜力”摆上了直播和开源台面。
