模型架构/术语条目
注意力机制
让模型动态关注输入序列中不同位置信息的机制,是Transformer的核心。
大白话:让模型动态关注输入序列中不同位置信息的机制,是Transformer的核心
换成大白话
注意力机制(Attention)让模型在处理每个位置时,能够动态计算并加权关注序列中其他位置的信息,从而捕捉长距离依赖关系。其核心是Query-Key-Value三元组:通过计算Query与所有Key的相似度得到注意力权重,再对Value加权求和。 自注意力(Self-Attention)指Q、K、V均来自同一序列,让每个位置都能"看到"序列中所有其他位置。多头注意力(Multi-Head Attention)则并行运行多组注意力,每组学习不同子空间的关系,最后拼接输出。 注意力机制解决了RNN无法并行、长距离梯度消失的问题,是Transformer、BERT、GPT等现代模型的基石。后续演化出稀疏注意力、线性注意力、FlashAttention等变体,以降低长序列的计算和内存开销。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“注意力机制”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“注意力机制”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。