Transformer架构三大支柱
自注意力机制、多头注意力和位置编码,共同实现高效并行处理和长距离依赖捕获。
前三
自注意力:替代循环网络的秘密
: 自注意力机制并行处理序列,高效捕捉长距离依赖,是其超越RNNs实现突破的关键。
多头注意力:多维度理解词语关系
: 多个注意力头并行计算,使模型能从不同“角度”理解词间关联,捕捉更丰富的语义。
位置编码:无循环结构下的顺序感
: 为无序词向量注入位置信息,Transformer因此能理解词语在序列中的前后关系。
来源
parseur.com
Arbisoft
打开完整版