📖
混合专家模型(MoE)
模型架构
一句话概括
通过路由机制只激活部分专家网络的前馈架构,以更少算力实现更大模型容量。
详细解析
混合专家模型(Mixture of Experts, MoE)是一种稀疏激活架构。它将传统Transformer中的前馈网络(FFN)替换为多个并行的"专家"网络,每个token只由路由器(Router)选出的1-2个专家处理,其余专家不参与计算。
MoE的核心优势是"解耦参数量与计算量":一个拥有万亿参数的MoE模型,单次推理可能只激活几百亿参数,从而在保持大模型容量的同时控制推理成本。代表模型包括Mixtral 8x7B、DeepSeek-V3、GPT-4(据传)等。
MoE的挑战在于路由训练不稳定、专家负载不均衡、显存占用大(所有专家都需驻留显存)以及通信开销。它在降低单token推理成本方面效果显著,是当前大模型规模化的重要技术路线。