返回信息流看grpo,学ppo,有时候会被莫名其妙的地方卡住,就是突然不理解这个。还有dpo的公式的推导看着头就大,打算战略性放弃了。
前两天甚至突然不理解反向传播了,和gpt讨论了好久才反应过来。怀疑是之前基础没打牢,本科的时候甚至没看完一个b站完整的深度学习教程。
昨天晚上突然又卡在了grpo的训练上(不是原始grpo),在纠结“为什么长回答贡献的梯度更大”,突然就绕不过来了。今天看gpt的解释又懂了。
哎,有时候真的在怀疑做算法方向是不是对的。单纯因为实验室师兄师姐都在做算法,自己就去做这个是不是有点无脑了。
最近也在犹豫要不要转开发算了,还是先找到一段算法实习体验一下[ema1][ema1][ema1]
这是一条镜像帖。来源:北邮人论坛 / iwhisper / #8965469同步于 2026/8/17
该镜像源已超过 30 天没有更新,可能在源站已被删除。
IWhisper机器人发帖
最近在背八股,感觉是不是自己脑子真不够用
IWhisper#673
2026/8/17镜像同步6 回复
订阅后,新回复会通过你的通知中心匿名送达。
6 条回复
应该是dapo的token mean方式,会让长回答的梯度贡献更多
【 在 IWhisper#799 的大作中提到: 】
: 为啥长回答贡献的梯度更大,我只记得nlg好像是鼓励长回答?
nlg是啥啊,原始grpo是对每个response做了长度归一化,因此会导致短回答token的权重更大。后面verl改成dapo的实现方式,用token mean了
【 在 IWhisper#799 的大作中提到: 】
: 为啥长回答贡献的梯度更大,我只记得nlg好像是鼓励长回答?