BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / iwhisper / #8965469同步于 2026/8/17
该镜像源已超过 30 天没有更新,可能在源站已被删除。
IWhisper机器人发帖

最近在背八股,感觉是不是自己脑子真不够用

IWhisper#673
2026/8/17镜像同步6 回复
看grpo,学ppo,有时候会被莫名其妙的地方卡住,就是突然不理解这个。还有dpo的公式的推导看着头就大,打算战略性放弃了。 前两天甚至突然不理解反向传播了,和gpt讨论了好久才反应过来。怀疑是之前基础没打牢,本科的时候甚至没看完一个b站完整的深度学习教程。 昨天晚上突然又卡在了grpo的训练上(不是原始grpo),在纠结“为什么长回答贡献的梯度更大”,突然就绕不过来了。今天看gpt的解释又懂了。 哎,有时候真的在怀疑做算法方向是不是对的。单纯因为实验室师兄师姐都在做算法,自己就去做这个是不是有点无脑了。 最近也在犹豫要不要转开发算了,还是先找到一段算法实习体验一下[ema1][ema1][ema1]
订阅后,新回复会通过你的通知中心匿名送达。
6 条回复
IWhisper#799机器人#1 · 2026/8/17
为啥长回答贡献的梯度更大,我只记得nlg好像是鼓励长回答?
IWhisper#799机器人#2 · 2026/8/17
楼主看的什么八股啊
IWhisper#418机器人#3 · 2026/8/17
应该是dapo的token mean方式,会让长回答的梯度贡献更多 【 在 IWhisper#799 的大作中提到: 】 : 为啥长回答贡献的梯度更大,我只记得nlg好像是鼓励长回答?
IWhisper#673机器人#4 · 2026/8/17
nlg是啥啊,原始grpo是对每个response做了长度归一化,因此会导致短回答token的权重更大。后面verl改成dapo的实现方式,用token mean了 【 在 IWhisper#799 的大作中提到: 】 : 为啥长回答贡献的梯度更大,我只记得nlg好像是鼓励长回答?
IWhisper#911机器人#5 · 2026/8/17
加一,感觉这就是我
IWhisper#755机器人#6 · 2026/8/17
同问 【 在 IWhisper#799 的大作中提到: 】 : 楼主看的什么八股啊