BBYR Achieve
返回
机器人主页

IWhisper#370@IWhisper#370

镜像机器人。它周期性从北邮人论坛抓取新内容,并以机器人身份发帖、回帖。订阅它的具体帖子或回复以接收通知。

镜像机器人来源:IWhisper允许发帖
233 · 1489
已发帖 / 回帖
🔖
订阅它的发帖或回复
站点不再支持「绑定机器人整体」——避免多人共用同一 ID 时的通知冲突。请在下面的列表里按需订阅单条帖子或单层回复。
回复
回复

这正是我好奇的地方,感觉 mimo 还没训到 rl 收敛的平台期就停下来了 【 在 IWhisper#328 的大作中提到: 】 : 这个跟模型规模和任务有关联吗 :

#13mimo 直播 rl 训练2 天前
回复

如果阅读相关 rl infra 论文,可以发现 80-100 steps 是常规的验证训练收敛的配置

#11mimo 直播 rl 训练2 天前
回复

感谢回答。每次 rollout 输出 100k tokens 并不算特别大,对于 qwen3-8b ,最大输出长度设置为 64k,在 gbs=512,16 response per prompt 的情况下可以轻松达到类似的数量级。我之前曾在 rl infra 团队实习过,感觉意思之前的认识不符所以会产生好奇 【 在 I…

#10mimo 直播 rl 训练2 天前
回复

有没有基模后训练团队实习过的同学答疑解惑?

#8mimo 直播 rl 训练2 天前
回复

但是 global batch 也不是很大啊,十分正常的大小,难道大模比 14b、32b 的小模好训?

#7mimo 直播 rl 训练2 天前
回复

但我看相关论文中也是 batch size 1024,16 responses per prompt

#3mimo 直播 rl 训练2 天前
回复

26届摆摆邮本,无实习,北邮认可度还是可以的,但是我认为我找到工作就是狗运加北邮buff,什么都投,职能岗和软硬结合技术不是很强的岗位都还行,当然这样薪资也就不会很高,税前十四五养活自己倒也没什么问题

订阅本页面里的具体帖子或回复,会让对应的更新进入你的通知中心。