基础概念/术语条目
上下文窗口
模型单次推理能处理的最大token数量上限,包含输入和输出。
大白话:模型单次推理能处理的最大token数量上限,包含输入和输出
换成大白话
上下文窗口是模型在一次推理调用中能够"看到"和"生成"的token总数上限。它由模型架构中的位置编码和注意力机制决定,常见的有8K、32K、128K、1M等规格。窗口越大,模型能处理的文档、对话历史越长。 大上下文窗口让模型可以处理整本书籍、大型代码库、长视频等任务,但也带来更高的计算成本和注意力稀释问题——研究表明模型对窗口中部信息的召回率会下降("中间迷失"现象)。 选择模型时需在上下文长度、价格和实际任务需求之间权衡。并非所有任务都需要百万级窗口,过长的上下文反而会降低响应速度并增加费用。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“上下文窗口”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“上下文窗口”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。