2026-04-30 11:33更新
智谱AI推出GLM-5底层LayerSplit模型记忆缓存分层存储方案
智谱AI公布GLM-5大模型推理基础设施优化成果,推出“LayerSplit”KV Cache分层存储方案,通过让每张GPU仅持有部分层的KV Cache显著降低单卡显存占用,长上下文场景下系统处理速度最高提升132%,吞吐量提升10%-132%,该方案已获SGLang开源社区采纳,可解决Coding Agent等长上下文场景的Prefill瓶颈。
来自 星盘大模型百科
xingpanai.com
智谱AI公布GLM-5大模型推理基础设施优化成果,推出“LayerSplit”KV Cache分层存储方案,通过让每张GPU仅持有部分层的KV Cache显著降低单卡显存占用,长上下文场景下系统处理速度最高提升132%,吞吐量提升10%-132%,该方案已获SGLang开源社区采纳,可解决Coding Agent等长上下文场景的Prefill瓶颈。
来自 星盘大模型百科