技术分享
Transformer并行化
1 分钟读完229 字更新于 2024年3月16日
Transformer 并行化
Encoder 并行化
Encoder不需要像RNN一样输出依赖于前一个输出,因此可以并行化计算所有的而无需严格按照时序进行迭代计算。
Decoder 并行化
Decoder 能够部分并行化训练,主要基于两个特点:
- teacher force
- masked self-attention
teacher force是指在训练每一轮预测中,不使用上一轮预测的结果,而强制使用正确的单词。这可以避免因中间预测错误而导致后续全部错误,加快训练速度。基于这一特性,Decoder可以实现部分并行化。
然而在推理中,Decoder在t时刻无法提前得知t+1的结果,因此还是需要按照时序迭代计算。
masked self-attention可以确保训练时所有的token一同输入又不作弊,而RNN因为需要隐藏状态而做不到这一点。