📖
注意力机制
模型架构
一句话概括
让模型动态关注输入序列中不同位置信息的机制,是Transformer的核心。
详细解析
注意力机制(Attention)让模型在处理每个位置时,能够动态计算并加权关注序列中其他位置的信息,从而捕捉长距离依赖关系。其核心是Query-Key-Value三元组:通过计算Query与所有Key的相似度得到注意力权重,再对Value加权求和。
自注意力(Self-Attention)指Q、K、V均来自同一序列,让每个位置都能"看到"序列中所有其他位置。多头注意力(Multi-Head Attention)则并行运行多组注意力,每组学习不同子空间的关系,最后拼接输出。
注意力机制解决了RNN无法并行、长距离梯度消失的问题,是Transformer、BERT、GPT等现代模型的基石。后续演化出稀疏注意力、线性注意力、FlashAttention等变体,以降低长序列的计算和内存开销。