基础设施

MoE(专家混合)

一种模型架构,把全部参数拆分成多个专门化的"专家"子网络,每次请求只激活其中一小部分,而不是动用整个模型。

稠密(dense)模型处理每一个 token 时都要用上全部参数。而 MoE(专家混合)模型则包含许多更小的专家子网络,并由一个"路由器"为每个 token 挑选其中一小部分(往往是几十个专家里的寥寥几个)来处理。

MoE 的吸引力在于效率:它让模型可以拥有非常庞大的总参数量、以及随之而来的能力,而实际推理所付出的算力成本却只相当于一个小得多的"激活模型"。2025-2026 年间多款顶尖规模的模型采用 MoE 设计,正是出于这个原因。