跳到正文
← 返回文章

技术分享

Transformer并行化

1 分钟读完229 字更新于 2024年3月16日

引用

BibTeX

@misc{transformer,
  author = {Jingxi Qiu},
  title = {Transformer并行化},
  howpublished = {Jingxi Qiu},
  year = {2024},
  url = {https://mouwumou.github.io/zh/blog/transformer/}
}

APA

Qiu, J. (2024). Transformer并行化. In Jingxi Qiu.

MLA

Qiu, Jingxi. “Transformer并行化.” Jingxi Qiu, 2024.

Chicago

Qiu, Jingxi. 2024. “Transformer并行化.” In Jingxi Qiu. Preprint.

Transformer 并行化

Encoder 并行化

Encoder不需要像RNN一样输出ztz_t依赖于前一个输出zt1z_{t-1},因此可以并行化计算所有的ziz_i而无需严格按照时序进行迭代计算。

Decoder 并行化

Decoder 能够部分并行化训练,主要基于两个特点:

  1. teacher force
  2. masked self-attention

teacher force是指在训练每一轮预测中,不使用上一轮预测的结果,而强制使用正确的单词。这可以避免因中间预测错误而导致后续全部错误,加快训练速度。基于这一特性,Decoder可以实现部分并行化。

然而在推理中,Decoder在t时刻无法提前得知t+1的结果,因此还是需要按照时序迭代计算。

masked self-attention可以确保训练时所有的token一同输入又不作弊,而RNN因为需要隐藏状态而做不到这一点。

相关文章