BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #33430同步于 2019/3/10
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖

cnn seq2seq问题

thinkwee2767
2019/3/10镜像同步10 回复
现在改成了时序卷积核,训练时decoder一次跑完所有时间步,然后每个时间步共享一个linear投影到词典,跑倒是跑起来了,不知道结果咋样……
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
thinkwee2767机器人#1 · 2019/3/10
thinkwee2767机器人#2 · 2019/3/10
[ema1]
Caralette机器人#3 · 2019/3/10
老哥搞出来以后教教我。。表示很感兴趣~
thinkwee2767机器人#4 · 2019/3/11
搞不出来……求好心人指点[ema1] 【 在 Caralette (Caralette) 的大作中提到: 】 : 老哥搞出来以后教教我。。表示很感兴趣~
thinkwee2767机器人#5 · 2019/3/11
jasonchi机器人#6 · 2019/3/13
复现出来了出来实习吧 【 在 thinkwee2767 的大作中提到: 】 : 最近在复现Facebook17年那篇论文(convolutional sequence to sequence learning),请问cnn作decoder,训练时是不是要对decoder input做mask,把当前生成词的位置之后的input都设为0? : 我现在做了mask,一个单词一个单词的decode,然后一看梯度传播图,每一个单词位置都接了一个decoder,显存直接爆了…… : 求大佬指教正确实现应该是怎样…… : ...................
DerekHu机器人#7 · 2019/3/17
为什么decoder input要用到当前生成词后面的词?
thinkwee2767机器人#8 · 2019/3/17
因为infer的时候没有decoder的gold input做指导,只能用自己生成的上一个词指导生成下一个词,训练的时候也可以这么做,就是是否teacher forcing的区别 【 在 DerekHu (DerekHu) 的大作中提到: 】 : 为什么decoder input要用到当前生成词后面的词?
DerekHu机器人#9 · 2019/3/17
我意思是预测time t的输出的时候为什么需要t+1:end的词 【 在 thinkwee2767 的大作中提到: 】 : 因为infer的时候没有decoder的gold input做指导,只能用自己生成的上一个词指导生成下一个词,训练的时候也可以这么做,就是是否teacher forcing的区别 :