⚙️ 边缘 AI 与端侧芯片:手机里跑大模型

云上 AI 强,但贵、慢、还不够私密。 2025-2026 起,所有手机、PC、汽车、家电—— 都开始塞 AI 算力。 这场”AI 下沉”的本质,是 NPU。

⚙️ AI 深度派专栏 · 第 S2-25 期 📅 2026年11月10日 ✍️ 小敏说 AI

💡 本文要点:本文讲清端侧 AI 为什么必然兴起、NPU 是什么、苹果 / 高通 / 联发科 / 国产端侧芯片格局、端侧大模型的现实能力。


🎯 本文导读

  • 🔹 为什么 AI 要下沉到端侧
  • 🔹 NPU 是什么
  • 🔹 主流端侧 AI 芯片
  • 🔹 端侧大模型能力上限
  • 🔹 未来场景

一、☁️➡️📱 为什么 AI 必须下沉

云端的局限

| 维度 | 痛点 | |—|—| | 隐私 | 你的语音 / 图 / 行为,都被上传 | | 延迟 | 网络往返 100-500 ms | | 成本 | 用户量上来,API 费用爆 | | 离线 | 没网就死 | | 个性化 | 难做”你专属” |

端侧的优势

  • 隐私在本地
  • 响应 < 50 ms
  • 单次成本接近 0
  • 可离线
  • 学习你的习惯

💬 关键观点:云 + 端混合,是 AI 时代的”必然架构”。


二、🧠 NPU 是什么

NPU(Neural Processing Unit) = 端侧的小型”Tensor Core”。

特点:

  • 专为神经网络优化
  • INT8 / FP16 / FP8 / 稀疏支持
  • 超低功耗(毫瓦级 → 几瓦)
传统 SoC:CPU + GPU + ISP + DSP
现代 AI SoC:CPU + GPU + NPU + ISP + DSP
                ↑
              新主角

三、📱 主流端侧 AI 芯片

苹果(Apple Neural Engine)

  • iPhone 15-17 Pro:~35-38 TOPS
  • M3/M4:~38 TOPS
  • Apple Intelligence 全本地

高通骁龙

  • 8 Gen 3:45 TOPS
  • 8 Gen 4 / X Elite:~75 TOPS
  • 主打”AI PC”

联发科天玑

  • 9300/9400:~50-60 TOPS
  • 国内 Android 阵地

华为麒麟 / 昇腾端侧

  • 麒麟 9000S/9020:自研 NPU
  • 与盘古端侧模型搭配

Intel / AMD AI PC

  • Intel Core Ultra:NPU + GPU 混合
  • AMD Ryzen AI:Hawk Point / Strix Point,端侧 NPU 突破 50 TOPS

Microsoft Copilot+ PC

  • 标准:≥ 40 TOPS NPU
  • 推动 PC 全面 AI 化

🎯 一句话总结:40 TOPS = 2025+ 端侧 AI 设备的入门标准。


四、📊 端侧大模型能力上限

当前能跑(2026)

| 模型 | 端侧 | |—|—| | Phi-3-mini (3.8B) | ✅ 旗舰手机流畅 | | Llama 3.2 (1B/3B) | ✅ 主流手机 | | Qwen 2.5 (3B/7B) | ✅ 中高端 | | Gemini Nano | ✅ Pixel / Galaxy | | Apple On-Device LLM | ✅ ~3B 量级 |

性能

  • 旗舰手机:~20-50 tokens/sec(7B 模型 INT4)
  • PC NPU:50-100 tokens/sec(7B 模型)

限制

  • 端侧 ≤ 7B 模型(13B 太挤)
  • 长上下文受限(8K-32K)
  • 多模态:图 ✅,视频仍很难

五、🔋 关键技术

量化(Quantization)

| 精度 | 显存压缩 | 质量损失 | |—|—|—| | INT8 | 2× | ~1% | | INT4 | 4× | ~3-5% | | INT2 | 8× | 可观但研究中 |

端侧主流:INT4。

蒸馏(Distillation)

大模型当老师,小模型当学生,3B 模型也能达到 70B 的 70% 能力(特定任务)。

LoRA / Adapter

端侧个性化微调,几 MB 文件即可。


六、🏠 未来场景

已经发生

  • iPhone 写作助手、邮件总结
  • Pixel 录音转文字 + 实时翻译
  • Copilot+ PC 本地 Recall
  • 三星 Galaxy AI

1-2 年内

  • 手机 AI Agent:替你订餐、回消息
  • 离线翻译眼镜
  • 车内 LLM 助手:本地,秒响应
  • 智能家居:电视 / 音箱 / 摄像头本地推理

3-5 年内

  • 每个家电都自带”小脑”
  • 个人 AI 全本地,云只做”知识更新”
  • 端侧大模型 + 端侧 Agent = 新平台

七、🆚 云 vs 端

维度 云 端
模型规模 数千亿 <10B
延迟 百毫秒 几十毫秒
隐私 弱 强
个性化 弱 强
离线 ❌ ✅
复杂推理 强 弱

→ 混合调度才是答案:

轻任务 → 端
重任务 → 云
敏感任务 → 端

八、❌ 常见误区

误区 真相
❌ 端侧 AI 玩具 ✅ 已能跑 7B 实用模型
❌ 云能干的端不行 ✅ 90% 日常任务端就够
❌ TOPS 越高越强 ✅ 还要看带宽、精度、软件栈
❌ 端侧模型 = 蒸馏 ✅ 也可原生小模型

九、🎁 给非工程读者的”端侧 AI 心法”

🔑 NPU = 端侧的 Tensor Core
🔑 40 TOPS 起 = AI 设备入门标准
🔑 你的 Phi-3 / Llama 3.2 / Qwen 2.5 7B 已能在手机跑
🔑 端云混合是未来 5 年的形态
🔑 端侧最大价值 = 隐私 + 个性化 + 永远在线

📮 今日话题:你愿意为”完全本地的 AI 助手”换手机吗?

🔮 下一篇预告:s2ep26《AI 缺电与能源:核电 / 光伏 / 储能怎么救场》


⚙️ 本系列是「小敏说 AI · AI 深度派专栏」第 S2-25 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。