📖
上下文长度
模型架构
一句话概括
模型能处理的最大输入序列长度,通常以token数衡量。
详细解析
上下文长度(Context Length)指模型架构支持的最大输入序列token数,是上下文窗口的技术上限。它由位置编码方案、注意力机制的内存复杂度共同决定。早期GPT-2支持1024,GPT-3提升到2K,现代模型已扩展到128K、1M甚至10M。
扩展上下文长度的技术包括:相对位置编码(RoPE、ALiBi)、稀疏注意力、滑动窗口注意力、Ring Attention等。这些技术突破了传统注意力的O(n²)内存瓶颈,使长文档、长视频、长对话成为可能。
上下文长度与上下文窗口常被混用,但前者偏架构能力、后者偏产品规格。选择模型时需结合实际任务:代码理解、长文档摘要、多轮对话等场景需要长上下文,而短问答则无需为此支付溢价。