模型架构/术语条目
混合专家模型(MoE)
通过路由机制只激活部分专家网络的前馈架构,以更少算力实现更大模型容量。
大白话:通过路由机制只激活部分专家网络的前馈架构,以更少算力实现更大模型容量
换成大白话
混合专家模型(Mixture of Experts, MoE)是一种稀疏激活架构。它将传统Transformer中的前馈网络(FFN)替换为多个并行的"专家"网络,每个token只由路由器(Router)选出的1-2个专家处理,其余专家不参与计算。 MoE的核心优势是"解耦参数量与计算量":一个拥有万亿参数的MoE模型,单次推理可能只激活几百亿参数,从而在保持大模型容量的同时控制推理成本。代表模型包括Mixtral 8x7B、DeepSeek-V3、GPT-4(据传)等。 MoE的挑战在于路由训练不稳定、专家负载不均衡、显存占用大(所有专家都需驻留显存)以及通信开销。它在降低单token推理成本方面效果显著,是当前大模型规模化的重要技术路线。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“混合专家模型(MoE)”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“混合专家模型(MoE)”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。