📖
上下文窗口
基础概念
一句话概括
模型单次推理能处理的最大token数量上限,包含输入和输出。
详细解析
上下文窗口是模型在一次推理调用中能够"看到"和"生成"的token总数上限。它由模型架构中的位置编码和注意力机制决定,常见的有8K、32K、128K、1M等规格。窗口越大,模型能处理的文档、对话历史越长。
大上下文窗口让模型可以处理整本书籍、大型代码库、长视频等任务,但也带来更高的计算成本和注意力稀释问题——研究表明模型对窗口中部信息的召回率会下降("中间迷失"现象)。
选择模型时需在上下文长度、价格和实际任务需求之间权衡。并非所有任务都需要百万级窗口,过长的上下文反而会降低响应速度并增加费用。