6天,350万美元(约合人民币2344万元)——小米把一场大模型强化学习训练搬进直播间,美元计价器一路狂跳,最终以MiMo-V2.6-Pro与Flash双双完成30个训练Step收官。Pro用时5天3小时花掉约260万美元,Flash用时3天10小时花掉约90万美元,成为史上首次全程直播的前沿模型RL训练。

钱烧出了什么

MiMo-V2.6-Pro总参数1.02万亿、激活420亿,在Artificial Analysis Intelligence Index拿到46分,登顶全球开源第一,多数Agent评测已逼近Claude Opus 5与GPT-5.6 Sol;在AutomationBench上以53.1分超过Claude Opus 5(50.3)与GPT-5.6 Sol(45.8)。更有说服力的是样本外测试DeepSWE v1.1:Pro从58.4升至72.57,Flash从48.7升至65.68——只跑30个Step就把能力迁移到未见过的真实软件工程任务,不是训练集原地刷分。

价格没有跟着涨:Pro每百万Token输入/输出约3元/6元,按AA测算完成一项智能指数任务平均成本仅0.13美元——同日发布、同拿46分的闭源Grok 4.7(xHigh)需要3.74美元,相差29倍。UltraSpeed模式最高约900 TPS。

开源全家桶

模型权重、完整技术报告、7000多个RL任务环境、端到端RL训练框架、可自由组合的mini-harnesses全部开放,另有以Qwen3.5-9B为底座、用77.4B Token蒸馏数据完成SFT的MiMo-V2.6-Distill-Qwen-9B。Hugging Face CEO公开称赞,Ai2后训练负责人Nathan Lambert力挺"最高分开源模型+公开RL仪表盘"的组合。

从Vibe Coding到Vibe World

训练刚结束,小米前沿材料团队就把MiMo-V2.6-Pro扔进一个没有专项训练过的科研场景:设计捕获PFAS"永久污染物"的MOF(金属有机框架)材料。模型自主检索文献、提出设计假设、核查新颖性、搭建模拟环境并调用开源计算工具验证,跑出的两种UiO-67型锆基候选结构对PFAS吸附性能达对照材料的百万至千万倍。北大窦金虎教授评价其表现"相当于训练有素的博士研究员"。该流程已用于内部新材料研发,周期从一个月压缩到2-3天。

📊 MiMo-V2.6 直播训练战报

· 总投入:350万美元 / 6天 / 30个Step(Pro+Flash)

· Pro:1.02T参数、42B激活,AA Index 46分开源第一

· DeepSWE v1.1样本外:Pro +14.2分、Flash +17.0分

· 单任务成本:0.13美元,为同级闭源模型的1/29

对中国AI产业而言,这场直播的意义超出小米本身:它把前沿RL训练的成本、过程与产出摆到了全行业面前——开源与闭源前沿的差距,正在被这种"透明+性价比"的组合快速抹平。

(事件信息综合自公开报道)