🟣 MoE 混合专家:DeepSeek / Mixtral / GPT 是怎么变”稀疏”的

DeepSeek V3 标称 671B 参数, 但每次推理只激活 37B。 这不是营销话术,是一种叫 MoE 的架构革命。

🟣 AI 深度派专栏 · 第 S2-01 期 📅 2026年9月15日 ✍️ 小敏说 AI

💡 本文要点:第二季「深度派」开篇。本文讲清 MoE(Mixture of Experts)是什么、为什么它能用”更小的算力”跑”更大的模型”、典型工程实现、以及它的代价。


🎯 本文导读

  • 🔹 Dense 模型的极限
  • 🔹 MoE 的核心思想:稀疏激活
  • 🔹 Router 是怎么决策的
  • 🔹 现代 MoE 三大代表
  • 🔹 MoE 的代价

一、🧱 Dense 模型的极限

传统 Transformer 是全密集(Dense):

  • 每个 Token 经过的每一层,所有参数都参与计算
  • 模型从 7B → 70B → 700B,算力线性甚至超线性增长

💬 关键观点:Dense 模型的”算力 = 参数量 × 序列长度”。规模一旦上千亿,训练 + 推理成本都爆炸。


二、🧠 MoE 的核心思想:稀疏激活

MoE 把 Transformer 的一层 FFN(前馈网络)拆成 N 个”专家”,每个 Token 只挑 K 个专家走。

传统:1 个大 FFN(所有 Token 都过)
MoE :8 / 64 / 256 个小专家
       Router 给每个 Token 选 Top-2 个专家
       该 Token 只激活那 2 个的参数

效果:

  • 总参数量大(容量大)
  • 激活参数量小(成本低)

🎯 一句话总结:MoE = 模型像图书馆,每次读书只翻 2 本,但藏书 256 本。


三、🚦 Router 是怎么决策的

Token x → Router 输出一组分数(每个专家一个)
       → 选 Top-K 最高分专家
       → 把 x 喂给这 K 个专家
       → 加权合并结果

关键挑战

| 问题 | 解法 | |—|—| | 负载不均(明星专家) | Auxiliary Loss 强制均衡 | | Token 丢弃 | Token Choice vs Expert Choice | | 训练不稳定 | DeepSeek 的”无 Aux Loss” 技巧 |

⚠️ 重要提醒:Router 训练好不好,决定整个 MoE 模型的天花板。


四、🏆 现代 MoE 三大代表

模型 总参数 激活参数 专家数 特点
Mixtral 8×7B 47B 13B 8 开源先驱
DeepSeek V3 671B 37B 256 + 共享 细粒度 + 高效路由
GPT-4 (传闻) ~1.8T ? 16 OpenAI 未官宣

DeepSeek 的两大创新

  1. Fine-grained Experts:把每个专家做小、做多
  2. Shared Experts:每个 Token 必经的”公共专家” + 路由专家

五、💸 MoE 的代价

代价 描述
显存大 推理时所有专家都得在显存里
通信成本高 多卡时 Token 要”飞来飞去”
训练难 比 Dense 更不稳定
批处理碎片化 不同 Token 走不同专家,难凑 batch

💬 关键观点:MoE 不是免费午餐——它把”算力成本”换成”显存 + 通信成本”。


六、❌ 常见误区

误区 真相
❌ MoE 比 Dense 智能 ✅ 容量更大,但需要更好训练
❌ “激活 37B” = “只用了 37B” ✅ 671B 全得在显存里
❌ MoE 是 2023 才出现 ✅ Google 2017 就提了
❌ 任何任务 MoE 都更好 ✅ 小任务 Dense 反而效率高

七、🔮 MoE 的未来

趋势 描述
专家更细更多 从 8 → 256 → ??
共享 + 路由混合 DeepSeek 模式成为主流
跨层路由 Mod-Squad、Branch-Train-MiX
模态专家 多模态 MoE,专家按模态分工

📮 今日话题:MoE 让”参数膨胀”重新变可行,你认为它会持续走多久?

🔮 下一篇预告:s2ep02《Diffusion 原理:AI 画图 / 视频的数学底层》


🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-01 期(第二季开篇)。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。