🌊 DeepSeek现象:一家低调公司如何搅动全球格局

一家公司没有硅谷式高调路演,却让全球 AI 资产重新定价。 一个开源模型,把“堆算力才有未来”的信仰撕开了一道口子。

🔬 AI 深度解析专栏 · 第 12 期
📅 2026年4月15日
✍️ 小敏说 AI

💡 本文要点:DeepSeek 最大的意义,不只是发布了一个强模型,而是证明“效率路径”可能改变全球 AI 竞争规则。


🎯 本文导读

  • 🔹 DeepSeek 起点不是传统互联网公司,而是量化基金 幻方量化(High-Flyer),背后有长期算法与算力积累。
  • 🔹 创始人 梁文锋 极其低调,公司不依赖外部融资,因此拥有接近学术实验室的自由度。
  • 🔹 在美国芯片管制背景下,DeepSeek 被迫走向效率创新,用 A100 / H800 做出接近顶级模型的效果。
  • 🔹 MoE、MLA、FP8 等技术路线共同降低训练与推理成本,推理成本一度被认为下降 90%+。
  • 🔹 R1 发布后,英伟达 单日暴跌 17%,市值蒸发约 5930亿美元,全球 AI 叙事被迫重写。

一、🧮 幻方量化:DeepSeek 不是突然冒出来的

DeepSeek 的故事,要从 幻方量化(High-Flyer) 说起。

幻方量化是中国头部量化基金之一,管理规模一度超过 千亿人民币。量化基金的本质,是用数学模型、统计方法和计算系统,在海量市场数据里寻找交易信号。

这类业务天然依赖算法、数据和算力。对幻方来说,AI 不是突然跨界,而是长期技术积累的延伸。

创始人 梁文锋 是一个非常低调的人。相比硅谷创业者频繁演讲、接受采访、塑造个人品牌,梁文锋几乎不追求曝光。公开信息有限,外界更多看到的是产品和论文。

这种低调反而让 DeepSeek 更有神秘感:没有强营销,没有明星创始人叙事,却在关键节点拿出让行业震动的模型。

早在 2019年,幻方量化就开始大规模囤积 GPU。到后来,外界普遍认为其拥有超过 10,000张 A100。在当时,这不是普通公司会做的配置,更像是提前押注 AI 基础设施。

2023年5月,梁文锋成立 DeepSeek,把相关 AI 团队独立出来。最关键的一点是:DeepSeek 的定位并不是“服务金融交易”,而是面向通用 AGI 研究。

这让它从一开始就与很多商业 AI 公司不同。它不需要马上卖 SaaS,不需要把模型包装成金融工具,也不需要向外部投资人证明短期收入。

背后有幻方利润支持,DeepSeek 获得了一种罕见自由:可以长期研究,可以开放论文,可以把资源投入模型架构与训练效率,而不是立刻追逐商业变现。

💬 关键观点:DeepSeek 并非凭空爆红,而是站在 幻方量化 多年算法、工程和算力积累之上。它最特殊的地方,是既有资金与算力,又没有典型融资驱动公司的短期 KPI。


二、🧠 独特组织结构:不融资,也不讨好资本市场

多数 AI 创业公司的路径很清晰:融资、买 GPU、训练模型、发布产品、继续融资。估值和资本叙事往往与技术路线绑定。

DeepSeek 不太一样。由于背后有 幻方量化 的资金支持,它不急于向外部融资,也不需要频繁向投资人解释商业化节奏。

这带来一个重要结果:研究优先级可以更长期。

很多公司会问:“这个模型能力能不能立刻收费?”DeepSeek 更像是在问:“这个技术方向是否能提升 AGI 研究效率?”

这种状态接近学术实验室,但又比传统学术机构拥有更强工程能力和算力资源。研究人员可以写论文、做开源、尝试底层架构创新,同时拥有工业级训练条件。

这也是 DeepSeek 论文和技术报告受到关注的原因。它不是只发布 API,而是把大量方法论公开,让外界能看到背后的技术路线。

不融资还有另一个影响:不必迎合估值故事。

在 AI 热潮中,许多公司需要证明“模型越大越好”“算力越多越强”“估值越高越接近 AGI”。DeepSeek 反而选择讲一个不太资本市场化的故事:用更少资源做出更强效果。

这条路听起来不性感,却很致命。因为一旦成立,就会动摇整个 AI 产业链的成本假设。

💬 关键观点:DeepSeek 的组织优势,不是规模最大,而是自由度高。没有外部融资压力,让它能把注意力放在效率、架构和开源影响力上,而不是短期商业包装。


三、⚙️ 效率至上:芯片限制反而逼出新路线

DeepSeek 的技术哲学可以概括为两个字:效率。

美国 AI 公司在过去几年里形成了一种直觉:模型越大、数据越多、GPU 越先进,能力越强。这个方向当然有效,但成本极高。

OpenAI、Google、Anthropic 等公司能够调用大量 H100 / H200 级别算力,并建立庞大训练集群。相比之下,中国公司面对美国芯片出口管制,很难稳定获得最先进 GPU。

DeepSeek 使用更多的是 A100,以及受限制版本的 H800。拿不到最先进芯片,就必须在架构、训练和推理上压榨效率。

这不是主动选择“节俭”,而是被环境逼出的创新。

第一个关键技术是 MoE(Mixture of Experts,混合专家)。传统 Dense 模型每次推理都动用大部分参数,而 MoE 把模型拆成多个专家,每次只激活部分专家。

特征 传统 Dense 模型 MoE 模型
参数利用 大量参数每次参与计算 每次只激活部分专家
计算效率 算力需求高 同等规模下更省算力
模型规模 受训练预算限制明显 总参数可以做得很大
训练难度 相对直接 需要复杂路由与负载均衡

DeepSeek 在 V2 中使用 MoE 架构,外界普遍关注到其推理成本降低 90%+ 的效果。这意味着同样处理用户请求,所需算力和成本大幅下降。

第二个关键技术是 MLA(Multi-Head Latent Attention)。大模型推理时,KV 缓存 会消耗大量显存,尤其在长上下文场景下更明显。

MLA 的思路,是把注意力中的关键信息压缩到潜在空间,减少 KV 缓存内存需求。它不只是省一点显存,而是影响长上下文与大规模服务部署成本。

第三个关键技术是 FP8 混合精度训练。相比更高精度,FP8 可以显著降低计算和内存需求,但难点是保持训练稳定性与模型效果。

DeepSeek 在大规模训练中使用 FP8,让外界看到低精度训练不只是理论优化,也能支撑前沿模型训练。

这些技术放在一起,形成了 DeepSeek 的核心叙事:不是用无限算力硬堆,而是通过架构和工程优化,把每一张 GPU 的价值榨出来。

💬 关键观点:DeepSeek 的“效率路线”不是简单省钱,而是系统性技术选择。MoE 降低计算浪费,MLA 降低显存压力,FP8 降低训练成本,三者共同挑战了“顶级模型必须极端烧钱”的行业假设。


四、📈 里程碑:从 V2 到 R1,节奏突然加速

DeepSeek 真正引发全球关注,是因为它在短时间内连续交出关键成果。

时间 模型 核心信息 行业意义
2024年5月 DeepSeek V2 236B MoE,每次仅激活约 21B 低成本推理引发价格战
2024年6月 DeepSeek Coder V2 强化代码能力 开发者群体开始关注
2024年12月 DeepSeek V3 671B MoE,仅用 2048张 H800 训练 训练效率震动行业
2025年1月 DeepSeek R1 推理能力接近 OpenAI o1,完全开源 全球 AI 叙事爆炸

DeepSeek V2 的重要之处,是把低成本推理带到台前。它让行业看到,模型服务价格可以被大幅压低。随后国内外模型 API 价格战迅速升温。

DeepSeek Coder V2 则强化了开发者心智。代码能力是大模型最刚需的场景之一,开发者愿意试用,生态传播速度就会变快。

DeepSeek V3 是一次更大的信号。一个 671B 总参数规模的 MoE 模型,据称训练只使用 2048张 H800。在全球都把顶级模型与巨型 GPU 集群绑定时,这个数字非常刺眼。

到了 R1,DeepSeek 彻底出圈。它在推理任务上接近 OpenAI o1,训练成本约 550万美元,并且选择完全开源。

约 550万美元 这个数字震动市场,因为此前顶级模型训练成本常被认为是数千万乃至数亿美元级别。如果同级能力可以用低一个数量级的成本实现,AI 基础设施投资逻辑就必须重新计算。

R1 的爆发不是单点事件,而是前面技术路线的集中兑现。V2 证明推理效率,V3 证明训练效率,R1 证明推理能力与开源传播可以同时成立。

更重要的是,这些里程碑彼此之间存在清晰递进关系。低成本推理先改变价格预期,代码模型再扩大开发者传播,超大 MoE 模型证明训练效率,R1 最后把推理能力和开源影响力推到全球舞台。它不是一次偶然爆点,而是一条被连续验证的技术路线。

这种节奏让竞争对手很难只用营销回应。模型公司必须拿出同样清楚的成本结构、性能曲线和产品落地能力,才能说服开发者与企业客户继续支付高溢价。

💬 关键观点:DeepSeek 的冲击来自连续性。V2 打价格,V3 打训练成本,R1 打推理能力与开源生态;每一步都在削弱“只有巨额算力投入才能做顶级 AI”的信念。


五、💥 R1 冲击波:为什么华尔街和硅谷同时震动?

2025年1月,DeepSeek R1 发布后,全球 AI 市场出现剧烈震荡。

最直观的反应来自资本市场。英伟达 单日下跌 17%,市值蒸发约 5930亿美元,成为史上最大单日市值蒸发之一。

为什么一个开源模型会让芯片龙头暴跌?

因为过去两年,AI 投资叙事高度依赖一个前提:未来模型能力提升需要越来越多高端 GPU。云厂商、模型公司和企业客户都会持续购买 H100 / H200,算力需求几乎没有上限。

DeepSeek R1 让市场突然意识到:如果顶级模型可以通过更高效率训练出来,对高端 GPU 的边际需求可能没有想象中那么夸张。

这不代表 GPU 不重要,也不代表英伟达失去护城河。但它让“无限堆卡”的确定性变弱了。

硅谷的反应同样复杂。Sam Altman 公开称赞 DeepSeek,承认其模型令人印象深刻。表面是赞赏,背后是对竞争格局变化的接受。

美国政府层面则出现新的争议:芯片管制到底有没有达到预期?如果限制 H100 反而逼出更高效率的架构创新,那管制是否会产生反效果?

行业内部的连锁反应更直接:降价。

DeepSeek V3 的价格约为 GPT-4o 的 1/25,这迫使其他模型厂商重新审视 API 定价。过去大模型服务价格带有明显“高端稀缺资源”逻辑,而 DeepSeek 把价格锚点大幅拉低。

对开发者和企业客户来说,这是好事。模型变便宜,应用实验成本下降,更多场景可以被验证。

对模型公司来说,这是压力。商业模式不能只靠“模型调用贵”维持,必须寻找产品、生态、企业服务和差异化能力。

💬 关键观点:R1 的真正冲击,不是让 GPU 变得不重要,而是让市场重新评估“算力投入与模型能力之间的关系”。当效率成为变量,AI 产业链估值逻辑就会被迫重写。


六、🌍 开源选择:DeepSeek 为什么愿意把牌摊开?

DeepSeek 最引人注目的选择之一,是开源。

在前沿模型领域,完全开源并不常见。顶级模型通常被视为核心资产,闭源 API 能带来商业收入,也能控制滥用风险。

DeepSeek 选择开放权重与技术细节,背后有多重动机。

第一,是学术基因。DeepSeek 更像研究实验室,重视论文、复现和同行评议。开源能让技术路线更快被验证,也能提升研究声誉。

第二,它不主要依靠模型 API 赚钱。由于背后有幻方支持,商业压力相对小。不开源保护收入的必要性没有那么强。

第三,开源是吸引人才的强信号。顶级研究者和工程师愿意加入一个能公开成果、影响全球开发者的团队。对一个核心团队约 500人 的公司来说,人才密度比组织规模更关键。

第四,开源带来生态影响力。开发者、本地部署厂商、云服务商、研究机构都会围绕模型做适配和优化。即使 DeepSeek 不直接收取所有价值,也能获得标准制定般的影响力。

第五,开源也是软实力投射。一个中国团队用有限资源做出前沿模型,并向全球开放,这会改变国际社会对中国 AI 能力的判断。

当然,开源也有代价。商业变现更难,模型被滥用的风险更高,竞争对手也可以学习技术细节。

但从 DeepSeek 的战略位置看,开源带来的声誉、人才和生态收益,可能比短期 API 收入更重要。

开源还降低了全球开发者的心理门槛。只要模型能下载、能微调、能本地部署,社区就会自发贡献教程、量化版本、工具链和行业适配方案。

这会让影响力跨越单家公司边界,进入更广泛的产业链。

生态会继续发酵。

💬 关键观点:DeepSeek 开源不是单纯理想主义,而是一种战略杠杆。它用开放换取全球关注、开发者生态、人才吸引和技术话语权。


七、⚠️ V4 展望与风险:神话之后,真正考验才开始

DeepSeek 已经证明自己能做出震动行业的模型,但下一阶段挑战会更复杂。

第一是芯片管制升级。R1 爆火后,美国对中国 AI 算力的限制很可能进一步加码。未来获取先进 GPU、建设训练集群、调用海外云资源都会面临更大不确定性。

第二是人才竞争。DeepSeek 核心团队约 500人,规模不算大,但人才密度高。问题在于,全球 AI 公司都会争夺同一批顶级研究者和工程师。

当一家公司突然站到聚光灯下,挖角、合作邀请、监管关注都会同步增加。保持组织纯度和研究节奏并不容易。

第三是商业化不确定。开源带来巨大影响力,但长期运营需要收入来源。DeepSeek 是否做 API、企业服务、私有化部署,还是继续保持研究优先,都需要更清晰路径。

第四是政策风险。作为中国 AI 标志性公司,DeepSeek 将不可避免地处于国际科技竞争和国内监管环境交叉点。模型能力越强,外部审视越严格。

第五是预期管理。R1 之后,外界会期待 V4 带来同等甚至更大惊喜。但技术突破不可能每次都按市场节奏发生。若后续模型提升不如预期,舆论反噬也会很快。

因此,DeepSeek 的下一阶段不只是“继续做强模型”,还要回答一个更难的问题:如何从技术震撼走向可持续组织。

这也让 DeepSeek V4 备受期待。外界关心的不只是分数是否更高,还包括训练是否继续低成本、推理是否继续便宜、开源边界是否保持,以及多模态、工具调用、长上下文能力能否补齐。

如果 V4 继续沿着效率路线前进,DeepSeek 将不再只是“R1 时刻”的制造者,而会变成全球 AI 产业中长期存在的技术参照系。

💬 关键观点:DeepSeek 的爆红解决了“能不能做出顶级模型”的问题,却带来了“如何长期稳定发展”的新问题。芯片、人才、商业化和政策,将共同决定它能走多远。


八、🧭 最大意义:效率路径改变 AI 竞争规则

DeepSeek 现象最大的意义,是证明 效率路径 可行。

过去两年,全球 AI 竞争几乎被一个叙事主导:谁拥有更多 GPU、更多资本、更多数据中心,谁就更接近未来。

这个叙事并没有错。算力仍然重要,资本仍然重要,基础设施仍然重要。

但 DeepSeek 补上了另一个变量:效率。

如果训练顶级模型的成本从数亿美元降到数百万美元,竞争格局会发生根本变化。更多国家、公司、研究机构和创业团队都有机会参与前沿模型研发。

这会带来三层影响。

第一,模型能力会更快普及。低成本训练与推理降低门槛,应用创新会加速。

第二,闭源巨头压力增加。开源模型如果足够强,企业客户会重新考虑是否必须绑定少数闭源 API。

第三,硬件投资逻辑更复杂。GPU 仍是核心资源,但市场会更关注单位算力产出,而不是单纯计算卡数量。

DeepSeek 不是终局答案,也不是所有公司都能复制的奇迹。它有幻方背景、人才密度、工程积累和特殊时代条件。

但它已经完成一件重要的事:让世界相信,AI 竞争不只有“烧钱堆规模”一条路。

💬 关键观点:DeepSeek 打开的不是一个模型窗口,而是一条产业路线。未来 AI 竞争会同时比拼算力规模与效率创新,谁能用更低成本释放更强能力,谁就拥有重新定义格局的机会。


🔮 趋势预判

第一,模型价格战会继续。DeepSeek V3 已经把价格锚点压到约 GPT-4o 的 1/25,其他厂商必须通过降价、差异化能力或企业服务来回应。

第二,开源模型会获得更强企业渗透。许多企业希望掌控数据与部署环境,强开源模型会推动私有化部署、本地推理和行业微调。

第三,美国芯片管制可能进一步升级,但效率创新也会同步加速。限制不会让需求消失,只会迫使团队寻找更省算力的架构。

第四,V4 会成为关键观察点。如果 DeepSeek 能持续提升能力,并保持成本优势,它将从“现象级爆红”升级为“长期竞争者”。

第五,全球 AI 格局会更分散。OpenAI、Google、Anthropic、Meta、DeepSeek 等会形成多强并立,不同路线分别代表闭源产品、开源生态、云基础设施与效率创新。

💬 关键观点:DeepSeek 之后,AI 行业不会回到原来的叙事。算力仍重要,但效率、开源和工程优化会拥有更高战略权重。


📮 今日话题

💬 如果顶级 AI 模型训练成本真的能从 数亿美元 降到 数百万美元,你认为未来更受益的是创业公司、开源社区,还是大厂云平台?


🔬 本文属于「AI 深度解析」系列,每期一个主题,追本质不追热点。

🎙️ 想听更轻松的版本?我们的每日 AI 快讯播客有更口语化的解读。
📱 关注「小敏说 AI」公众号,深度解析不水文。