模型架构/术语条目
Transformer架构
现代大语言模型的核心神经网络架构,通过自注意力机制并行处理序列数据。
大白话:现代大语言模型的核心神经网络架构,通过自注意力机制并行处理序列数据
换成大白话
Transformer是2017年Google在论文《Attention Is All You Need》中提出的神经网络架构。它彻底摒弃了RNN的序列计算方式,转而使用自注意力(Self-Attention)机制让模型在处理每个位置时能同时关注输入序列的所有位置,实现完全并行化计算。 其核心创新在于多头注意力机制,模型可以从不同子空间学习序列中的依赖关系。配合位置编码、前馈网络和残差连接,Transformer在处理长序列时既高效又强大。 几乎所有现代大语言模型(GPT、Claude、Gemini、LLaMA等)都基于Transformer架构,它已成为自然语言处理乃至计算机视觉、语音等领域的通用基础架构。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“Transformer架构”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“Transformer架构”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。