🔵 量化、蒸馏、剪枝:把大模型塞进手机的三招
🔵 量化、蒸馏、剪枝:把大模型塞进手机的三招
一个 700 亿参数的模型, 原生跑要 8 张顶级显卡。 经过三招压缩后,可以在你手机上跑。 这一篇讲清这三招到底干了什么。
🔵 AI 通识专栏 · 第 35 期 📅 2026年8月18日 ✍️ 小敏说 AI
💡 本文要点:本文讲清模型压缩三大主流技术——量化(Quantization)、蒸馏(Distillation)、剪枝(Pruning),它们各自的原理、损失、适用场景,以及为什么”端侧 AI”正在崛起。
🎯 本文导读
- 🔹 为什么要压缩
- 🔹 量化:把高精度数变成低精度
- 🔹 蒸馏:让小模型”模仿”大模型
- 🔹 剪枝:剪掉不重要的神经元
- 🔹 三招组合 + 端侧 AI
一、❓ 为什么要压缩
大模型有 4 个”原罪”:
| 问题 | 表现 |
|---|---|
| 内存 | 70B 模型要 140 GB |
| 算力 | 8×H100 起步 |
| 成本 | 单次推理几分钱 |
| 延迟 | 云端往返几百毫秒 |
压缩目标:保持 80-95% 能力,把成本降 5-50 倍。
二、🔢 招式 1:量化(Quantization)
原理
原本每个参数用 16 位浮点数(FP16)。 量化后改成 8 位整数(INT8)、4 位(INT4)甚至更低。
| 精度 | 内存占比 | 损失 |
|---|---|---|
| FP16 | 100% | 0% |
| INT8 | 50% | < 1% |
| INT4 | 25% | 1-5% |
| INT2 | 12.5% | 偏大 |
💬 关键观点:量化是性价比最高的压缩——几乎不损能力,体积减半再减半。
✅ 几乎所有”手机/本地能跑”的开源模型都用了量化。
三、🎓 招式 2:蒸馏(Distillation)
原理
让小模型(学生) 去学大模型(老师)的输出。
老师:DeepSeek V3(671B)
学生:DeepSeek-R1-Distill-Qwen-7B(7B)
学生通过模仿老师的回答,
拿到老师 80%+ 的能力,但体积小 100 倍。
代表案例
- DeepSeek-R1 蒸馏系列 —— 2025 年现象级
- GPT-4o-mini —— 几乎是 GPT-4o 的小弟
- Phi 系列(Microsoft)—— 小模型典范
🎯 一句话总结:蒸馏让”专家的判断力”装进”实习生的体型”。
四、✂️ 招式 3:剪枝(Pruning)
原理
神经网络里 60-90% 的连接其实”几乎没用”。 剪掉它们 → 体积小、速度快。
| 类型 | 做什么 |
|---|---|
| 结构化剪枝 | 整层 / 整通道砍掉 |
| 非结构化剪枝 | 单个权重置零 |
✅ 适合:对延迟敏感的端侧场景。 ⚠️ 比量化复杂、风险高,主流大模型用得少。
五、🔁 三招组合 + 端侧 AI
原始模型(70B FP16, 140GB)
↓ 蒸馏
中模型(7B FP16, 14GB)
↓ 量化
INT4 版本(3.5GB)
↓ 剪枝
最终可在 8GB 内存手机上跑
💬 关键观点:端侧 AI 的爆发,本质是”压缩三件套 + 芯片算力提升”两条曲线相交。
六、📱 端侧 AI 真实案例
| 场景 | 模型 |
|---|---|
| iPhone 上的 Apple Intelligence | 3B 端侧 + 云端协作 |
| 小米手机本地大模型 | MiLM 6B 量化版 |
| Mac 上跑 Llama | 7B INT4 + Ollama |
| 笔记本跑 Code 模型 | DeepSeek-Coder 量化版 |
七、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ 压缩等于变笨 | ✅ INT8 几乎无损 |
| ❌ 小模型 = 不能用 | ✅ 任务对口反而更好 |
| ❌ 蒸馏 = 抄答案 | ✅ 是合法的知识迁移 |
| ❌ 端侧 AI 永远不如云 | ✅ 隐私 + 延迟优势是云端给不了的 |
八、🎁 普通人能感知的变化
🔑 手机相册自动整理 → 端侧模型
🔑 输入法智能纠错 → 端侧模型
🔑 离线翻译耳机 → 端侧模型
🔑 手机本地"小助手" → 端侧模型
📮 今日话题:你希望手机本地能跑哪个 AI?为什么?
🔮 下一篇预告:ep36《本地部署:Ollama 一张显卡跑大模型——15 分钟入门指南》
🔵 本系列是「小敏说 AI · AI 通识专栏」第 35 期。 关注公众号 小敏说 AI,回复「AI 入门」领取《打工人 AI 自救工具箱》。