🟣 MoE 混合专家:DeepSeek / Mixtral / GPT 是怎么变”稀疏”的
DeepSeek V3 标称 671B 参数, 但每次推理只激活 37B。 这不是营销话术,是一种叫 MoE 的架构革命。
🟣 AI 深度派专栏 · 第 S2-01 期 📅 2026年9月15日 ✍️ 小敏说 AI
💡 本文要点:第二季「深度派」开篇。本文讲清 MoE(Mixture of Experts)是什么、为什么它能用”更小的算力”跑”更大的模型”、典型工程实现、以及它的代价。
🎯 本文导读
- 🔹 Dense 模型的极限
- 🔹 MoE 的核心思想:稀疏激活
- 🔹 Router 是怎么决策的
- 🔹 现代 MoE 三大代表
- 🔹 MoE 的代价
一、🧱 Dense 模型的极限
传统 Transformer 是全密集(Dense):
- 每个 Token 经过的每一层,所有参数都参与计算
- 模型从 7B → 70B → 700B,算力线性甚至超线性增长
💬 关键观点:Dense 模型的”算力 = 参数量 × 序列长度”。规模一旦上千亿,训练 + 推理成本都爆炸。
二、🧠 MoE 的核心思想:稀疏激活
MoE 把 Transformer 的一层 FFN(前馈网络)拆成 N 个”专家”,每个 Token 只挑 K 个专家走。
传统:1 个大 FFN(所有 Token 都过)
MoE :8 / 64 / 256 个小专家
Router 给每个 Token 选 Top-2 个专家
该 Token 只激活那 2 个的参数
效果:
- 总参数量大(容量大)
- 激活参数量小(成本低)
🎯 一句话总结:MoE = 模型像图书馆,每次读书只翻 2 本,但藏书 256 本。
三、🚦 Router 是怎么决策的
Token x → Router 输出一组分数(每个专家一个)
→ 选 Top-K 最高分专家
→ 把 x 喂给这 K 个专家
→ 加权合并结果
关键挑战
| 问题 | 解法 | |—|—| | 负载不均(明星专家) | Auxiliary Loss 强制均衡 | | Token 丢弃 | Token Choice vs Expert Choice | | 训练不稳定 | DeepSeek 的”无 Aux Loss” 技巧 |
⚠️ 重要提醒:Router 训练好不好,决定整个 MoE 模型的天花板。
四、🏆 现代 MoE 三大代表
| 模型 | 总参数 | 激活参数 | 专家数 | 特点 |
|---|---|---|---|---|
| Mixtral 8×7B | 47B | 13B | 8 | 开源先驱 |
| DeepSeek V3 | 671B | 37B | 256 + 共享 | 细粒度 + 高效路由 |
| GPT-4 (传闻) | ~1.8T | ? | 16 | OpenAI 未官宣 |
DeepSeek 的两大创新
- Fine-grained Experts:把每个专家做小、做多
- Shared Experts:每个 Token 必经的”公共专家” + 路由专家
五、💸 MoE 的代价
| 代价 | 描述 |
|---|---|
| 显存大 | 推理时所有专家都得在显存里 |
| 通信成本高 | 多卡时 Token 要”飞来飞去” |
| 训练难 | 比 Dense 更不稳定 |
| 批处理碎片化 | 不同 Token 走不同专家,难凑 batch |
💬 关键观点:MoE 不是免费午餐——它把”算力成本”换成”显存 + 通信成本”。
六、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ MoE 比 Dense 智能 | ✅ 容量更大,但需要更好训练 |
| ❌ “激活 37B” = “只用了 37B” | ✅ 671B 全得在显存里 |
| ❌ MoE 是 2023 才出现 | ✅ Google 2017 就提了 |
| ❌ 任何任务 MoE 都更好 | ✅ 小任务 Dense 反而效率高 |
七、🔮 MoE 的未来
| 趋势 | 描述 |
|---|---|
| 专家更细更多 | 从 8 → 256 → ?? |
| 共享 + 路由混合 | DeepSeek 模式成为主流 |
| 跨层路由 | Mod-Squad、Branch-Train-MiX |
| 模态专家 | 多模态 MoE,专家按模态分工 |
📮 今日话题:MoE 让”参数膨胀”重新变可行,你认为它会持续走多久?
🔮 下一篇预告:s2ep02《Diffusion 原理:AI 画图 / 视频的数学底层》
🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-01 期(第二季开篇)。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。