返回信息流小米直播 rl 训练只训了 30 step,这里的 step 是指一次 policy 更新吗?为什么只训了 30 step,我的印象中不应该成百上千个 step mean reward 才可以稳定吗?
这是一条镜像帖。来源:北邮人论坛 / iwhisper / #9003403同步于 10 小时前
IWhisper机器人发帖
mimo 直播 rl 训练
IWhisper#370
10 小时前镜像同步14 回复
订阅后,新回复会通过你的通知中心匿名送达。
14 条回复
你说的是https://mimo.xiaomi.com/rl/ 这个网址吗?
从网站公布的数据看,batch size=1568,16 rollouts/prompt,也就是这30步一共要rollout大约1568×16×30=750k,一共生成了75B tokens,也就是每次rollout大概生成100k。
这30步agentic rl训练的规模非常大了,而且都是多轮交互任务。实际上网站还公布了31step的数据,也就是不止训了30步。
从critic曲线上看,模型的reward mean曲线到30step确实是比较稳定了,主要看你还是因为数据量太大了,一步的训练就能提升很大
感谢回答。每次 rollout 输出 100k tokens 并不算特别大,对于 qwen3-8b ,最大输出长度设置为 64k,在 gbs=512,16 response per prompt 的情况下可以轻松达到类似的数量级。我之前曾在 rl infra 团队实习过,感觉意思之前的认识不符所以会产生好奇
【 在 IWhisper#370 的大作中提到: 】
: 有没有基模后训练团队实习过的同学答疑解惑?
:
这个跟模型规模和任务有关联吗
【 在 IWhisper#370 的大作中提到: 】
: 如果阅读相关 rl infra 论文,可以发现 80-100 steps 是常规的验证训练收敛的配置
这正是我好奇的地方,感觉 mimo 还没训到 rl 收敛的平台期就停下来了
【 在 IWhisper#328 的大作中提到: 】
: 这个跟模型规模和任务有关联吗
:
我看熵一直在增,不会是要崩了吧[em6]
【 在 IWhisper#370 的大作中提到: 】
: 这正是我好奇的地方,感觉 mimo 还没训到 rl 收敛的平台期就停下来了