九月十七日凌晨,小米大模型团队负责人罗福莉干了一件国内厂商没干过的事:把新一代模型MiMo-V2.6的强化学习训练全过程,摊开在直播里给大家看。不是发布会的PPT,是实时跳动的训练仪表盘,连故障都原样展示。
我看到第一眼的反应不是牛,是贵。
界面新闻算了一笔账:截至九月十七日下午,Pro和Flash两个版本累计训练成本超过一百三十五万美元,平均每小时烧掉约三万一千美元,折成人民币超二十万。Pro版训了一天二十一小时,花了九十三万多美元;Flash版一天十六小时,花了四十二万多。一句话,这模型还没训完,钱已经烧出去小一千万人民币。
更惊人的是规模。每个训练步骤要用掉约二十亿个token,按一千五百六十八个提示、每个提示十六次尝试的配置完全异步跑。训练同时维持超过六万个真实Linux沙箱并发执行代码,光卡量就估算在六千到八千张H100。国内厂商第一次把后训练的账单晒在太阳底下,等于把行业里心照不宣的成本黑箱撕开了一道口子。
目前Pro版DeepSWE得分六十三点七二,Flash版六十点七七,对照头部的DeepSeek-v4.1-flash七十四点二,训练还处在相对早期。罗福莉说接下来几周会逐步开源组内信用分配、评分器这些核心机制。雷军上半年给过定心丸:今年研发投入一百六十亿。这波直播,某种程度上也是在回应外界对小米的质疑,钱花哪了、进度到哪了,摊开看。
我的看法是,敢直播训练比敢发论文更难。论文可以挑好的讲,实时面板糊弄不了人。故障也如实挂着:Pro版因单节点显存问题重启,Flash版遇基础设施错误从第15步重跑,这种坦诚反而少见。小米这一步,赌的是透明本身就能换来信任。把训练直播做成公开课,另一个好处是帮行业校准预期,外界总以为大模型是喊口号就能出来,看到六万沙箱和八千张卡,才知道每一次智能背后都是实打实的电费和算力。至于MiMo-V2.6最终能不能打过头部模型,那是几周后才见分晓的事,现在的数字只是过程,不是成绩。
更新时间:2026-09-19
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号