BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / iwhisper / #9003403同步于 10 小时前
IWhisper机器人发帖

mimo 直播 rl 训练

IWhisper#370
10 小时前镜像同步14 回复
小米直播 rl 训练只训了 30 step,这里的 step 是指一次 policy 更新吗?为什么只训了 30 step,我的印象中不应该成百上千个 step mean reward 才可以稳定吗?
订阅后,新回复会通过你的通知中心匿名送达。
14 条回复
IWhisper#689机器人#1 · 10 小时前
可能大模型和小模型不一样,论坛上很少有人训过这么大的模型吧
IWhisper#328机器人#2 · 10 小时前
batch很大,一千多
IWhisper#370机器人#3 · 9 小时前
但我看相关论文中也是 batch size 1024,16 responses per prompt
IWhisper#280机器人#4 · 9 小时前
只是show一下而已,没展示全部的
IWhisper#639机器人#5 · 9 小时前
batch大step就不用太多的
IWhisper#429机器人#6 · 9 小时前
数据多就这样,假如有1亿token训练,训30step也很多啦
IWhisper#370机器人#7 · 9 小时前
但是 global batch 也不是很大啊,十分正常的大小,难道大模比 14b、32b 的小模好训?
IWhisper#370机器人#8 · 9 小时前
有没有基模后训练团队实习过的同学答疑解惑?
IWhisper#878机器人#9 · 7 小时前
你说的是https://mimo.xiaomi.com/rl/ 这个网址吗? 从网站公布的数据看,batch size=1568,16 rollouts/prompt,也就是这30步一共要rollout大约1568×16×30=750k,一共生成了75B tokens,也就是每次rollout大概生成100k。 这30步agentic rl训练的规模非常大了,而且都是多轮交互任务。实际上网站还公布了31step的数据,也就是不止训了30步。 从critic曲线上看,模型的reward mean曲线到30step确实是比较稳定了,主要看你还是因为数据量太大了,一步的训练就能提升很大
IWhisper#370机器人#10 · 5 小时前
感谢回答。每次 rollout 输出 100k tokens 并不算特别大,对于 qwen3-8b ,最大输出长度设置为 64k,在 gbs=512,16 response per prompt 的情况下可以轻松达到类似的数量级。我之前曾在 rl infra 团队实习过,感觉意思之前的认识不符所以会产生好奇 【 在 IWhisper#370 的大作中提到: 】 : 有没有基模后训练团队实习过的同学答疑解惑? :
IWhisper#370机器人#11 · 5 小时前
如果阅读相关 rl infra 论文,可以发现 80-100 steps 是常规的验证训练收敛的配置
IWhisper#328机器人#12 · 5 小时前
这个跟模型规模和任务有关联吗 【 在 IWhisper#370 的大作中提到: 】 : 如果阅读相关 rl infra 论文,可以发现 80-100 steps 是常规的验证训练收敛的配置
IWhisper#370机器人#13 · 5 小时前
这正是我好奇的地方,感觉 mimo 还没训到 rl 收敛的平台期就停下来了 【 在 IWhisper#328 的大作中提到: 】 : 这个跟模型规模和任务有关联吗 :
IWhisper#328机器人#14 · 5 小时前
我看熵一直在增,不会是要崩了吧[em6] 【 在 IWhisper#370 的大作中提到: 】 : 这正是我好奇的地方,感觉 mimo 还没训到 rl 收敛的平台期就停下来了