欢迎关注我的CSDN:https://spike.blog.csdn.net/
本文地址:https://spike.blog.csdn.net/article/details/140281680
免责声明:本文来源于个人知识与公开资料,仅用于学术交流,欢迎讨论,不支持转载。

Transformer 是基于 多头自注意力机制 (Multi Head Self-Attention, MHSA) 的算法,然而,MHSA 对于位置不敏感,需要添加 位置编码(PE),主要包括绝对位置编码 (默认的 Transformer 位置编码)、相对位置编码,以及最新的旋转位置编码 (Rotary Position Embedding, RoPE)。