⚙️ 边缘 AI 与端侧芯片:手机里跑大模型
⚙️ 边缘 AI 与端侧芯片:手机里跑大模型
云上 AI 强,但贵、慢、还不够私密。 2025-2026 起,所有手机、PC、汽车、家电—— 都开始塞 AI 算力。 这场”AI 下沉”的本质,是 NPU。
⚙️ AI 深度派专栏 · 第 S2-25 期 📅 2026年11月10日 ✍️ 小敏说 AI
💡 本文要点:本文讲清端侧 AI 为什么必然兴起、NPU 是什么、苹果 / 高通 / 联发科 / 国产端侧芯片格局、端侧大模型的现实能力。
🎯 本文导读
- 🔹 为什么 AI 要下沉到端侧
- 🔹 NPU 是什么
- 🔹 主流端侧 AI 芯片
- 🔹 端侧大模型能力上限
- 🔹 未来场景
一、☁️➡️📱 为什么 AI 必须下沉
云端的局限
| 维度 | 痛点 | |—|—| | 隐私 | 你的语音 / 图 / 行为,都被上传 | | 延迟 | 网络往返 100-500 ms | | 成本 | 用户量上来,API 费用爆 | | 离线 | 没网就死 | | 个性化 | 难做”你专属” |
端侧的优势
- 隐私在本地
- 响应 < 50 ms
- 单次成本接近 0
- 可离线
- 学习你的习惯
💬 关键观点:云 + 端混合,是 AI 时代的”必然架构”。
二、🧠 NPU 是什么
NPU(Neural Processing Unit) = 端侧的小型”Tensor Core”。
特点:
- 专为神经网络优化
- INT8 / FP16 / FP8 / 稀疏支持
- 超低功耗(毫瓦级 → 几瓦)
传统 SoC:CPU + GPU + ISP + DSP
现代 AI SoC:CPU + GPU + NPU + ISP + DSP
↑
新主角
三、📱 主流端侧 AI 芯片
苹果(Apple Neural Engine)
- iPhone 15-17 Pro:~35-38 TOPS
- M3/M4:~38 TOPS
- Apple Intelligence 全本地
高通骁龙
- 8 Gen 3:45 TOPS
- 8 Gen 4 / X Elite:~75 TOPS
- 主打”AI PC”
联发科天玑
- 9300/9400:~50-60 TOPS
- 国内 Android 阵地
华为麒麟 / 昇腾端侧
- 麒麟 9000S/9020:自研 NPU
- 与盘古端侧模型搭配
Intel / AMD AI PC
- Intel Core Ultra:NPU + GPU 混合
- AMD Ryzen AI:Hawk Point / Strix Point,端侧 NPU 突破 50 TOPS
Microsoft Copilot+ PC
- 标准:≥ 40 TOPS NPU
- 推动 PC 全面 AI 化
🎯 一句话总结:40 TOPS = 2025+ 端侧 AI 设备的入门标准。
四、📊 端侧大模型能力上限
当前能跑(2026)
| 模型 | 端侧 | |—|—| | Phi-3-mini (3.8B) | ✅ 旗舰手机流畅 | | Llama 3.2 (1B/3B) | ✅ 主流手机 | | Qwen 2.5 (3B/7B) | ✅ 中高端 | | Gemini Nano | ✅ Pixel / Galaxy | | Apple On-Device LLM | ✅ ~3B 量级 |
性能
- 旗舰手机:~20-50 tokens/sec(7B 模型 INT4)
- PC NPU:50-100 tokens/sec(7B 模型)
限制
- 端侧 ≤ 7B 模型(13B 太挤)
- 长上下文受限(8K-32K)
- 多模态:图 ✅,视频仍很难
五、🔋 关键技术
量化(Quantization)
| 精度 | 显存压缩 | 质量损失 | |—|—|—| | INT8 | 2× | ~1% | | INT4 | 4× | ~3-5% | | INT2 | 8× | 可观但研究中 |
端侧主流:INT4。
蒸馏(Distillation)
大模型当老师,小模型当学生,3B 模型也能达到 70B 的 70% 能力(特定任务)。
LoRA / Adapter
端侧个性化微调,几 MB 文件即可。
六、🏠 未来场景
已经发生
- iPhone 写作助手、邮件总结
- Pixel 录音转文字 + 实时翻译
- Copilot+ PC 本地 Recall
- 三星 Galaxy AI
1-2 年内
- 手机 AI Agent:替你订餐、回消息
- 离线翻译眼镜
- 车内 LLM 助手:本地,秒响应
- 智能家居:电视 / 音箱 / 摄像头本地推理
3-5 年内
- 每个家电都自带”小脑”
- 个人 AI 全本地,云只做”知识更新”
- 端侧大模型 + 端侧 Agent = 新平台
七、🆚 云 vs 端
| 维度 | 云 | 端 |
|---|---|---|
| 模型规模 | 数千亿 | <10B |
| 延迟 | 百毫秒 | 几十毫秒 |
| 隐私 | 弱 | 强 |
| 个性化 | 弱 | 强 |
| 离线 | ❌ | ✅ |
| 复杂推理 | 强 | 弱 |
→ 混合调度才是答案:
轻任务 → 端
重任务 → 云
敏感任务 → 端
八、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ 端侧 AI 玩具 | ✅ 已能跑 7B 实用模型 |
| ❌ 云能干的端不行 | ✅ 90% 日常任务端就够 |
| ❌ TOPS 越高越强 | ✅ 还要看带宽、精度、软件栈 |
| ❌ 端侧模型 = 蒸馏 | ✅ 也可原生小模型 |
九、🎁 给非工程读者的”端侧 AI 心法”
🔑 NPU = 端侧的 Tensor Core
🔑 40 TOPS 起 = AI 设备入门标准
🔑 你的 Phi-3 / Llama 3.2 / Qwen 2.5 7B 已能在手机跑
🔑 端云混合是未来 5 年的形态
🔑 端侧最大价值 = 隐私 + 个性化 + 永远在线
📮 今日话题:你愿意为”完全本地的 AI 助手”换手机吗?
🔮 下一篇预告:s2ep26《AI 缺电与能源:核电 / 光伏 / 储能怎么救场》
⚙️ 本系列是「小敏说 AI · AI 深度派专栏」第 S2-25 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。