应用概念/术语条目
推理
模型训练完成后,对输入数据生成输出的过程,是模型部署使用的阶段。
大白话:模型训练完成后,对输入数据生成输出的过程,是模型部署使用的阶段
换成大白话
推理(Inference)是模型训练完成后,对输入数据执行前向计算、生成输出的过程,是模型"被使用"的阶段。与训练相比,推理不更新参数,只做前向传播。 推理是模型服务的主要成本来源。推理性能受模型参数量、上下文长度、批处理大小、硬件(GPU/TPU)、推理框架(vLLM、TensorRT-LLM、SGLang)等影响。关键指标包括:首token延迟(TTFT)、每token延迟、吞吐量(tokens/s)、并发数。 推理优化技术包括:KV Cache、PagedAttention、连续批处理(Continuous Batching)、量化(INT8/INT4)、推测解码(Speculative Decoding)等。这些技术显著降低推理成本,是大模型规模化部署的关键。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“推理”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“推理”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。