⚙️ 推理新势力:Cerebras / Groq / SambaNova

NVIDIA 是训练之王。 但推理是另一个战场—— 这里冒出了三家完全”不走寻常路”的玩家。 它们做的事情,听起来都像异端,但让你看到 Llama 跑出 500 tokens/秒。

⚙️ AI 深度派专栏 · 第 S2-19 期 📅 2026年10月27日 ✍️ 小敏说 AI

💡 本文要点:本文讲清 Cerebras(晶圆级巨芯)、Groq(LPU + 确定性)、SambaNova(数据流架构)这三家”推理新势力”的核心创新、真实战绩、商业前景。


🎯 本文导读

  • 🔹 为什么推理需要新硬件
  • 🔹 Cerebras:一整块晶圆
  • 🔹 Groq:LPU 极速推理
  • 🔹 SambaNova:数据流架构
  • 🔹 它们会颠覆 NVIDIA 吗

一、❓ 为什么推理需要新硬件

GPU 是为”训练”设计的——追求吞吐。

推理需求恰恰相反:

  • 低延迟(用户等不及)
  • 高 token/s(chat 体验)
  • 低成本(API 价格压力)
  • 大批量(千万 QPS)

💬 关键观点:推理是 AI 算力的”大头”——长期看比训练市场大 5-10 倍。

⇒ 这就给新势力开了一道门。


二、🌊 Cerebras:一整块晶圆

核心创新

Wafer-Scale Engine(WSE):不切割晶圆,一整片当成一个芯片用。

WSE-3 数据:

  • 面积:46225 mm²(普通 GPU 的 50 倍以上)
  • 晶体管:4 万亿
  • 核心:90 万
  • 片上 SRAM:44 GB
  • 片上带宽:21 PB/s

优势

✅ 整个模型放在芯片上——没有 HBM 瓶颈 ✅ 超低延迟 ✅ Llama 3.1 405B 跑出 ~969 tokens/sec(远超 NVIDIA)

劣势

❌ 单片成本极高 ❌ 良率挑战 ❌ 软件生态小众


三、⚡ Groq:LPU 与”确定性推理”

核心创新

LPU(Language Processing Unit):完全为 LLM 推理设计。

特点:

  • 没有 HBM,全部用片上 SRAM
  • 确定性执行——无缓存、无分支预测,时序可预测
  • 极致流水线

战绩

  • Llama 3 70B 跑出 ~300-500 tokens/sec
  • 比 NVIDIA H100 快 5-10 倍(推理延迟维度)

商业模式

  • Groq Cloud:按 token 计费,价格几乎是 OpenAI 一半

劣势

❌ 单卡显存小(仅 230MB SRAM) ❌ 大模型需大量卡拼接 ❌ 训练不支持

🎯 一句话总结:Groq = 把 LLM 推理做成”专用 ASIC”。


四、🌐 SambaNova:数据流架构

核心创新

Reconfigurable Dataflow Unit(RDU):把神经网络的”计算图”映射到硬件上。

特点:

  • 数据流计算——不像 GPU 那样取指令
  • 可重配置——不同模型可调度不同流水线
  • 3D-stacked memory——大容量片内存储

优势

✅ 大模型 + 长上下文场景效率高 ✅ 单系统支持 5 万亿参数模型(DataScale) ✅ 政府 / 金融大客户偏好

劣势

❌ 价格高 ❌ 主要做”整机出售”,不像 Groq 直接面向开发者


五、📊 三家对比

维度 Cerebras Groq SambaNova
路线 晶圆级巨芯 LPU + SRAM 数据流
主战场 高速 + 大模型推理 超低延迟 大模型整机
速度(70B) ~600 t/s ~500 t/s 高
显存 44 GB SRAM 230 MB 大 HBM
训练能力 强 无 中
商业模式 整机 + 云 Cloud API 整机

六、💰 价格冲击

Groq 一度把 Llama 推理价格做到:

  • 比 OpenAI 便宜 50-70%
  • 比 NVIDIA 自建便宜 30-50%

⇒ 引发 NVIDIA 在 B200 设计上重新强调推理(H100 = 训练偏多)。

⚠️ 重要提醒:B200 / B100 + NVL72 已经在反击。新势力 vs NVIDIA 的拉锯战才刚开始。


七、⚔️ 它们会颠覆 NVIDIA 吗

维度 我的判断
训练 NVIDIA 不可撼动
高速推理细分 新势力 30-40% 份额可能
通用云推理 NVIDIA + AMD 主导
端侧推理 高通 / Apple / 国产主导

💬 关键观点:推理市场不会”赢者通吃”——会分裂成多种专用硬件。


八、❌ 常见误区

误区 真相
❌ Groq 比 NVIDIA 强 ✅ 单项强,整体生态差
❌ 新势力替代 NVIDIA ✅ 短期分推理细分
❌ 速度快 = 一定省钱 ✅ 看 batch + 利用率
❌ 这些公司都靠创新活 ✅ 也都需要”巨额融资 + 大客户”

九、🎁 给非工程读者的”推理新势力心法”

🔑 推理市场 > 训练市场(长期)
🔑 推理硬件多元化是必然
🔑 看真实战绩:tokens/sec + 单 token 成本
🔑 NVIDIA 不会被颠覆,但份额会被分

📮 今日话题:你愿意为更快的 AI 响应额外付费吗?

🔮 下一篇预告:s2ep20《分布式训练:DP / TP / PP / ZeRO 全图谱》


⚙️ 本系列是「小敏说 AI · AI 深度派专栏」第 S2-19 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。