混合专家模型(MoE)是一种神经网络架构:将模型拆成多个"专家"子网络,每次输入只激活其中一部分,在扩大模型参数量的同时控制推理成本。
AI Glossary
混合专家模型(Mixture of Experts,简称 MoE)是一种神经网络架构设计:整个模型由多个相对独立的"专家"子网络(Expert)和一个"路由器"(Router/Gating Network)组成。每次处理一个输入时,路由器只挑选一小部分专家参与计算,而不是让所有参数都跑一遍。
MoE 的关键在于"稀疏激活":
传统稠密模型(如 GPT-4 同代的稠密架构)参数越多越聪明,但每次推理都要跑全部参数,成本随规模线性上涨。MoE 用"总参数量换能力、激活量控制成本":同样规模的模型,MoE 的推理成本远低于稠密模型。DeepSeek-V3、通义千问等国产大模型,以及多家开源模型都采用 MoE 架构,是当前大模型工程的主流方向。
MoE 常用于:大语言模型(提升能力同时控成本)、多任务模型(不同任务走不同专家)。需要注意的是:MoE 的优势主要体现在大规模模型与高并发推理场景;小模型或低并发场景下,路由开销可能抵消收益,并非所有场景都该上 MoE。