📖
推理
应用概念
一句话概括
模型训练完成后,对输入数据生成输出的过程,是模型部署使用的阶段。
详细解析
推理(Inference)是模型训练完成后,对输入数据执行前向计算、生成输出的过程,是模型"被使用"的阶段。与训练相比,推理不更新参数,只做前向传播。
推理是模型服务的主要成本来源。推理性能受模型参数量、上下文长度、批处理大小、硬件(GPU/TPU)、推理框架(vLLM、TensorRT-LLM、SGLang)等影响。关键指标包括:首token延迟(TTFT)、每token延迟、吞吐量(tokens/s)、并发数。
推理优化技术包括:KV Cache、PagedAttention、连续批处理(Continuous Batching)、量化(INT8/INT4)、推测解码(Speculative Decoding)等。这些技术显著降低推理成本,是大模型规模化部署的关键。