🔵 量化、蒸馏、剪枝:把大模型塞进手机的三招

一个 700 亿参数的模型, 原生跑要 8 张顶级显卡。 经过三招压缩后,可以在你手机上跑。 这一篇讲清这三招到底干了什么。

🔵 AI 通识专栏 · 第 35 期 📅 2026年8月18日 ✍️ 小敏说 AI

💡 本文要点:本文讲清模型压缩三大主流技术——量化(Quantization)、蒸馏(Distillation)、剪枝(Pruning),它们各自的原理、损失、适用场景,以及为什么”端侧 AI”正在崛起。


🎯 本文导读

  • 🔹 为什么要压缩
  • 🔹 量化:把高精度数变成低精度
  • 🔹 蒸馏:让小模型”模仿”大模型
  • 🔹 剪枝:剪掉不重要的神经元
  • 🔹 三招组合 + 端侧 AI

一、❓ 为什么要压缩

大模型有 4 个”原罪”:

问题 表现
内存 70B 模型要 140 GB
算力 8×H100 起步
成本 单次推理几分钱
延迟 云端往返几百毫秒

压缩目标:保持 80-95% 能力,把成本降 5-50 倍。


二、🔢 招式 1:量化(Quantization)

原理

原本每个参数用 16 位浮点数(FP16)。 量化后改成 8 位整数(INT8)、4 位(INT4)甚至更低。

精度 内存占比 损失
FP16 100% 0%
INT8 50% < 1%
INT4 25% 1-5%
INT2 12.5% 偏大

💬 关键观点:量化是性价比最高的压缩——几乎不损能力,体积减半再减半。

✅ 几乎所有”手机/本地能跑”的开源模型都用了量化。


三、🎓 招式 2:蒸馏(Distillation)

原理

让小模型(学生) 去学大模型(老师)的输出。

老师:DeepSeek V3(671B)
学生:DeepSeek-R1-Distill-Qwen-7B(7B)

学生通过模仿老师的回答,
拿到老师 80%+ 的能力,但体积小 100 倍。

代表案例

  • DeepSeek-R1 蒸馏系列 —— 2025 年现象级
  • GPT-4o-mini —— 几乎是 GPT-4o 的小弟
  • Phi 系列(Microsoft)—— 小模型典范

🎯 一句话总结:蒸馏让”专家的判断力”装进”实习生的体型”。


四、✂️ 招式 3:剪枝(Pruning)

原理

神经网络里 60-90% 的连接其实”几乎没用”。 剪掉它们 → 体积小、速度快。

类型 做什么
结构化剪枝 整层 / 整通道砍掉
非结构化剪枝 单个权重置零

✅ 适合:对延迟敏感的端侧场景。 ⚠️ 比量化复杂、风险高,主流大模型用得少。


五、🔁 三招组合 + 端侧 AI

原始模型(70B FP16, 140GB)
   ↓ 蒸馏
中模型(7B FP16, 14GB)
   ↓ 量化
INT4 版本(3.5GB)
   ↓ 剪枝
最终可在 8GB 内存手机上跑

💬 关键观点:端侧 AI 的爆发,本质是”压缩三件套 + 芯片算力提升”两条曲线相交。


六、📱 端侧 AI 真实案例

场景 模型
iPhone 上的 Apple Intelligence 3B 端侧 + 云端协作
小米手机本地大模型 MiLM 6B 量化版
Mac 上跑 Llama 7B INT4 + Ollama
笔记本跑 Code 模型 DeepSeek-Coder 量化版

七、❌ 常见误区

误区 真相
❌ 压缩等于变笨 ✅ INT8 几乎无损
❌ 小模型 = 不能用 ✅ 任务对口反而更好
❌ 蒸馏 = 抄答案 ✅ 是合法的知识迁移
❌ 端侧 AI 永远不如云 ✅ 隐私 + 延迟优势是云端给不了的

八、🎁 普通人能感知的变化

🔑 手机相册自动整理 → 端侧模型
🔑 输入法智能纠错 → 端侧模型
🔑 离线翻译耳机 → 端侧模型
🔑 手机本地"小助手" → 端侧模型

📮 今日话题:你希望手机本地能跑哪个 AI?为什么?

🔮 下一篇预告:ep36《本地部署:Ollama 一张显卡跑大模型——15 分钟入门指南》


🔵 本系列是「小敏说 AI · AI 通识专栏」第 35 期。 关注公众号 小敏说 AI,回复「AI 入门」领取《打工人 AI 自救工具箱》。