微信邦

 找回密码
 立即注册

QQ登录

只需一步,快速开始

查看: 29|回复: 0

小米直播烧钱,罗福莉公开后训练大模型!每秒 10 美元

[复制链接]
发表于 5 天前 | 显示全部楼层 |阅读模式
作者 | 汤安迪
编辑 | 周欢

小米集团 MiMo 大模型负责人罗福莉表示:

近半年沉默。我们用这段时间研究一个问题:强化学习(RL)能扩展到多远。


MiMo-V2.6 目前正处于其 RL 运行的中途。我们扩展了三件事:计算资源(每步约 20 亿 token,1568 个提示 × 16 次 rollout,完全异步)、环境和测试框架(多任务代理式 RL,在一次运行中混合多个测试框架),以及评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。我们将在未来几周逐步开源细节。

注意它实际上是在进行 Agentic RL, 因为我们能看到衡量训练效果的测试集是DeepSWE, 不过从训练时间和得分来看, 还处于训练早期阶段.。

目前mimo-v2.6-pro 的 DeepSWE得分是62, 而现在的头部模型比如DeepSeek-v4.1-flash 是 74.2. 所以训练处于相对早期。

按照H100来估算, 单卡吞吐在100-150tps 左右的话, 那么大概就需要4000-5000张H100。注意这还只是训练pro用来解码的。还有flash模型的, 算下来大概是2000-2500 张H100。

这就是小米的烧钱速度。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

微信邦网联系QQ|Archiver|手机版|小黑屋|鲁公网安备 37082802000167号|微信邦 ( 鲁ICP备19043418号-5 )

GMT+8, 2026-9-22 02:36 , Processed in 0.082488 second(s), 19 queries .

Powered by Discuz! X3.4

© 2001-2013 Wxuse Inc. | Style by ytl QQ:1400069288

快速回复 返回顶部 返回列表