返回信息流现在改成了时序卷积核,训练时decoder一次跑完所有时间步,然后每个时间步共享一个linear投影到词典,跑倒是跑起来了,不知道结果咋样……
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #33430同步于 2019/3/10
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖
cnn seq2seq问题
thinkwee2767
2019/3/10镜像同步10 回复
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
搞不出来……求好心人指点[ema1]
【 在 Caralette (Caralette) 的大作中提到: 】
: 老哥搞出来以后教教我。。表示很感兴趣~
复现出来了出来实习吧
【 在 thinkwee2767 的大作中提到: 】
: 最近在复现Facebook17年那篇论文(convolutional sequence to sequence learning),请问cnn作decoder,训练时是不是要对decoder input做mask,把当前生成词的位置之后的input都设为0?
: 我现在做了mask,一个单词一个单词的decode,然后一看梯度传播图,每一个单词位置都接了一个decoder,显存直接爆了……
: 求大佬指教正确实现应该是怎样……
: ...................
因为infer的时候没有decoder的gold input做指导,只能用自己生成的上一个词指导生成下一个词,训练的时候也可以这么做,就是是否teacher forcing的区别
【 在 DerekHu (DerekHu) 的大作中提到: 】
: 为什么decoder input要用到当前生成词后面的词?
我意思是预测time t的输出的时候为什么需要t+1:end的词
【 在 thinkwee2767 的大作中提到: 】
: 因为infer的时候没有decoder的gold input做指导,只能用自己生成的上一个词指导生成下一个词,训练的时候也可以这么做,就是是否teacher forcing的区别
: