🔬 DeepSeek现象:一家低调公司如何搅动全球格局
🌊 DeepSeek现象:一家低调公司如何搅动全球格局
一家公司没有硅谷式高调路演,却让全球 AI 资产重新定价。 一个开源模型,把“堆算力才有未来”的信仰撕开了一道口子。
🔬 AI 深度解析专栏 · 第 12 期
📅 2026年4月15日
✍️ 小敏说 AI
💡 本文要点:DeepSeek 最大的意义,不只是发布了一个强模型,而是证明“效率路径”可能改变全球 AI 竞争规则。
🎯 本文导读
- 🔹 DeepSeek 起点不是传统互联网公司,而是量化基金 幻方量化(High-Flyer),背后有长期算法与算力积累。
- 🔹 创始人 梁文锋 极其低调,公司不依赖外部融资,因此拥有接近学术实验室的自由度。
- 🔹 在美国芯片管制背景下,DeepSeek 被迫走向效率创新,用 A100 / H800 做出接近顶级模型的效果。
- 🔹 MoE、MLA、FP8 等技术路线共同降低训练与推理成本,推理成本一度被认为下降 90%+。
- 🔹 R1 发布后,英伟达 单日暴跌 17%,市值蒸发约 5930亿美元,全球 AI 叙事被迫重写。
一、🧮 幻方量化:DeepSeek 不是突然冒出来的
DeepSeek 的故事,要从 幻方量化(High-Flyer) 说起。
幻方量化是中国头部量化基金之一,管理规模一度超过 千亿人民币。量化基金的本质,是用数学模型、统计方法和计算系统,在海量市场数据里寻找交易信号。
这类业务天然依赖算法、数据和算力。对幻方来说,AI 不是突然跨界,而是长期技术积累的延伸。
创始人 梁文锋 是一个非常低调的人。相比硅谷创业者频繁演讲、接受采访、塑造个人品牌,梁文锋几乎不追求曝光。公开信息有限,外界更多看到的是产品和论文。
这种低调反而让 DeepSeek 更有神秘感:没有强营销,没有明星创始人叙事,却在关键节点拿出让行业震动的模型。
早在 2019年,幻方量化就开始大规模囤积 GPU。到后来,外界普遍认为其拥有超过 10,000张 A100。在当时,这不是普通公司会做的配置,更像是提前押注 AI 基础设施。
2023年5月,梁文锋成立 DeepSeek,把相关 AI 团队独立出来。最关键的一点是:DeepSeek 的定位并不是“服务金融交易”,而是面向通用 AGI 研究。
这让它从一开始就与很多商业 AI 公司不同。它不需要马上卖 SaaS,不需要把模型包装成金融工具,也不需要向外部投资人证明短期收入。
背后有幻方利润支持,DeepSeek 获得了一种罕见自由:可以长期研究,可以开放论文,可以把资源投入模型架构与训练效率,而不是立刻追逐商业变现。
💬 关键观点:DeepSeek 并非凭空爆红,而是站在 幻方量化 多年算法、工程和算力积累之上。它最特殊的地方,是既有资金与算力,又没有典型融资驱动公司的短期 KPI。
二、🧠 独特组织结构:不融资,也不讨好资本市场
多数 AI 创业公司的路径很清晰:融资、买 GPU、训练模型、发布产品、继续融资。估值和资本叙事往往与技术路线绑定。
DeepSeek 不太一样。由于背后有 幻方量化 的资金支持,它不急于向外部融资,也不需要频繁向投资人解释商业化节奏。
这带来一个重要结果:研究优先级可以更长期。
很多公司会问:“这个模型能力能不能立刻收费?”DeepSeek 更像是在问:“这个技术方向是否能提升 AGI 研究效率?”
这种状态接近学术实验室,但又比传统学术机构拥有更强工程能力和算力资源。研究人员可以写论文、做开源、尝试底层架构创新,同时拥有工业级训练条件。
这也是 DeepSeek 论文和技术报告受到关注的原因。它不是只发布 API,而是把大量方法论公开,让外界能看到背后的技术路线。
不融资还有另一个影响:不必迎合估值故事。
在 AI 热潮中,许多公司需要证明“模型越大越好”“算力越多越强”“估值越高越接近 AGI”。DeepSeek 反而选择讲一个不太资本市场化的故事:用更少资源做出更强效果。
这条路听起来不性感,却很致命。因为一旦成立,就会动摇整个 AI 产业链的成本假设。
💬 关键观点:DeepSeek 的组织优势,不是规模最大,而是自由度高。没有外部融资压力,让它能把注意力放在效率、架构和开源影响力上,而不是短期商业包装。
三、⚙️ 效率至上:芯片限制反而逼出新路线
DeepSeek 的技术哲学可以概括为两个字:效率。
美国 AI 公司在过去几年里形成了一种直觉:模型越大、数据越多、GPU 越先进,能力越强。这个方向当然有效,但成本极高。
OpenAI、Google、Anthropic 等公司能够调用大量 H100 / H200 级别算力,并建立庞大训练集群。相比之下,中国公司面对美国芯片出口管制,很难稳定获得最先进 GPU。
DeepSeek 使用更多的是 A100,以及受限制版本的 H800。拿不到最先进芯片,就必须在架构、训练和推理上压榨效率。
这不是主动选择“节俭”,而是被环境逼出的创新。
第一个关键技术是 MoE(Mixture of Experts,混合专家)。传统 Dense 模型每次推理都动用大部分参数,而 MoE 把模型拆成多个专家,每次只激活部分专家。
| 特征 | 传统 Dense 模型 | MoE 模型 |
|---|---|---|
| 参数利用 | 大量参数每次参与计算 | 每次只激活部分专家 |
| 计算效率 | 算力需求高 | 同等规模下更省算力 |
| 模型规模 | 受训练预算限制明显 | 总参数可以做得很大 |
| 训练难度 | 相对直接 | 需要复杂路由与负载均衡 |
DeepSeek 在 V2 中使用 MoE 架构,外界普遍关注到其推理成本降低 90%+ 的效果。这意味着同样处理用户请求,所需算力和成本大幅下降。
第二个关键技术是 MLA(Multi-Head Latent Attention)。大模型推理时,KV 缓存 会消耗大量显存,尤其在长上下文场景下更明显。
MLA 的思路,是把注意力中的关键信息压缩到潜在空间,减少 KV 缓存内存需求。它不只是省一点显存,而是影响长上下文与大规模服务部署成本。
第三个关键技术是 FP8 混合精度训练。相比更高精度,FP8 可以显著降低计算和内存需求,但难点是保持训练稳定性与模型效果。
DeepSeek 在大规模训练中使用 FP8,让外界看到低精度训练不只是理论优化,也能支撑前沿模型训练。
这些技术放在一起,形成了 DeepSeek 的核心叙事:不是用无限算力硬堆,而是通过架构和工程优化,把每一张 GPU 的价值榨出来。
💬 关键观点:DeepSeek 的“效率路线”不是简单省钱,而是系统性技术选择。MoE 降低计算浪费,MLA 降低显存压力,FP8 降低训练成本,三者共同挑战了“顶级模型必须极端烧钱”的行业假设。
四、📈 里程碑:从 V2 到 R1,节奏突然加速
DeepSeek 真正引发全球关注,是因为它在短时间内连续交出关键成果。
| 时间 | 模型 | 核心信息 | 行业意义 |
|---|---|---|---|
| 2024年5月 | DeepSeek V2 | 236B MoE,每次仅激活约 21B | 低成本推理引发价格战 |
| 2024年6月 | DeepSeek Coder V2 | 强化代码能力 | 开发者群体开始关注 |
| 2024年12月 | DeepSeek V3 | 671B MoE,仅用 2048张 H800 训练 | 训练效率震动行业 |
| 2025年1月 | DeepSeek R1 | 推理能力接近 OpenAI o1,完全开源 | 全球 AI 叙事爆炸 |
DeepSeek V2 的重要之处,是把低成本推理带到台前。它让行业看到,模型服务价格可以被大幅压低。随后国内外模型 API 价格战迅速升温。
DeepSeek Coder V2 则强化了开发者心智。代码能力是大模型最刚需的场景之一,开发者愿意试用,生态传播速度就会变快。
DeepSeek V3 是一次更大的信号。一个 671B 总参数规模的 MoE 模型,据称训练只使用 2048张 H800。在全球都把顶级模型与巨型 GPU 集群绑定时,这个数字非常刺眼。
到了 R1,DeepSeek 彻底出圈。它在推理任务上接近 OpenAI o1,训练成本约 550万美元,并且选择完全开源。
约 550万美元 这个数字震动市场,因为此前顶级模型训练成本常被认为是数千万乃至数亿美元级别。如果同级能力可以用低一个数量级的成本实现,AI 基础设施投资逻辑就必须重新计算。
R1 的爆发不是单点事件,而是前面技术路线的集中兑现。V2 证明推理效率,V3 证明训练效率,R1 证明推理能力与开源传播可以同时成立。
更重要的是,这些里程碑彼此之间存在清晰递进关系。低成本推理先改变价格预期,代码模型再扩大开发者传播,超大 MoE 模型证明训练效率,R1 最后把推理能力和开源影响力推到全球舞台。它不是一次偶然爆点,而是一条被连续验证的技术路线。
这种节奏让竞争对手很难只用营销回应。模型公司必须拿出同样清楚的成本结构、性能曲线和产品落地能力,才能说服开发者与企业客户继续支付高溢价。
💬 关键观点:DeepSeek 的冲击来自连续性。V2 打价格,V3 打训练成本,R1 打推理能力与开源生态;每一步都在削弱“只有巨额算力投入才能做顶级 AI”的信念。
五、💥 R1 冲击波:为什么华尔街和硅谷同时震动?
2025年1月,DeepSeek R1 发布后,全球 AI 市场出现剧烈震荡。
最直观的反应来自资本市场。英伟达 单日下跌 17%,市值蒸发约 5930亿美元,成为史上最大单日市值蒸发之一。
为什么一个开源模型会让芯片龙头暴跌?
因为过去两年,AI 投资叙事高度依赖一个前提:未来模型能力提升需要越来越多高端 GPU。云厂商、模型公司和企业客户都会持续购买 H100 / H200,算力需求几乎没有上限。
DeepSeek R1 让市场突然意识到:如果顶级模型可以通过更高效率训练出来,对高端 GPU 的边际需求可能没有想象中那么夸张。
这不代表 GPU 不重要,也不代表英伟达失去护城河。但它让“无限堆卡”的确定性变弱了。
硅谷的反应同样复杂。Sam Altman 公开称赞 DeepSeek,承认其模型令人印象深刻。表面是赞赏,背后是对竞争格局变化的接受。
美国政府层面则出现新的争议:芯片管制到底有没有达到预期?如果限制 H100 反而逼出更高效率的架构创新,那管制是否会产生反效果?
行业内部的连锁反应更直接:降价。
DeepSeek V3 的价格约为 GPT-4o 的 1/25,这迫使其他模型厂商重新审视 API 定价。过去大模型服务价格带有明显“高端稀缺资源”逻辑,而 DeepSeek 把价格锚点大幅拉低。
对开发者和企业客户来说,这是好事。模型变便宜,应用实验成本下降,更多场景可以被验证。
对模型公司来说,这是压力。商业模式不能只靠“模型调用贵”维持,必须寻找产品、生态、企业服务和差异化能力。
💬 关键观点:R1 的真正冲击,不是让 GPU 变得不重要,而是让市场重新评估“算力投入与模型能力之间的关系”。当效率成为变量,AI 产业链估值逻辑就会被迫重写。
六、🌍 开源选择:DeepSeek 为什么愿意把牌摊开?
DeepSeek 最引人注目的选择之一,是开源。
在前沿模型领域,完全开源并不常见。顶级模型通常被视为核心资产,闭源 API 能带来商业收入,也能控制滥用风险。
DeepSeek 选择开放权重与技术细节,背后有多重动机。
第一,是学术基因。DeepSeek 更像研究实验室,重视论文、复现和同行评议。开源能让技术路线更快被验证,也能提升研究声誉。
第二,它不主要依靠模型 API 赚钱。由于背后有幻方支持,商业压力相对小。不开源保护收入的必要性没有那么强。
第三,开源是吸引人才的强信号。顶级研究者和工程师愿意加入一个能公开成果、影响全球开发者的团队。对一个核心团队约 500人 的公司来说,人才密度比组织规模更关键。
第四,开源带来生态影响力。开发者、本地部署厂商、云服务商、研究机构都会围绕模型做适配和优化。即使 DeepSeek 不直接收取所有价值,也能获得标准制定般的影响力。
第五,开源也是软实力投射。一个中国团队用有限资源做出前沿模型,并向全球开放,这会改变国际社会对中国 AI 能力的判断。
当然,开源也有代价。商业变现更难,模型被滥用的风险更高,竞争对手也可以学习技术细节。
但从 DeepSeek 的战略位置看,开源带来的声誉、人才和生态收益,可能比短期 API 收入更重要。
开源还降低了全球开发者的心理门槛。只要模型能下载、能微调、能本地部署,社区就会自发贡献教程、量化版本、工具链和行业适配方案。
这会让影响力跨越单家公司边界,进入更广泛的产业链。
生态会继续发酵。
💬 关键观点:DeepSeek 开源不是单纯理想主义,而是一种战略杠杆。它用开放换取全球关注、开发者生态、人才吸引和技术话语权。
七、⚠️ V4 展望与风险:神话之后,真正考验才开始
DeepSeek 已经证明自己能做出震动行业的模型,但下一阶段挑战会更复杂。
第一是芯片管制升级。R1 爆火后,美国对中国 AI 算力的限制很可能进一步加码。未来获取先进 GPU、建设训练集群、调用海外云资源都会面临更大不确定性。
第二是人才竞争。DeepSeek 核心团队约 500人,规模不算大,但人才密度高。问题在于,全球 AI 公司都会争夺同一批顶级研究者和工程师。
当一家公司突然站到聚光灯下,挖角、合作邀请、监管关注都会同步增加。保持组织纯度和研究节奏并不容易。
第三是商业化不确定。开源带来巨大影响力,但长期运营需要收入来源。DeepSeek 是否做 API、企业服务、私有化部署,还是继续保持研究优先,都需要更清晰路径。
第四是政策风险。作为中国 AI 标志性公司,DeepSeek 将不可避免地处于国际科技竞争和国内监管环境交叉点。模型能力越强,外部审视越严格。
第五是预期管理。R1 之后,外界会期待 V4 带来同等甚至更大惊喜。但技术突破不可能每次都按市场节奏发生。若后续模型提升不如预期,舆论反噬也会很快。
因此,DeepSeek 的下一阶段不只是“继续做强模型”,还要回答一个更难的问题:如何从技术震撼走向可持续组织。
这也让 DeepSeek V4 备受期待。外界关心的不只是分数是否更高,还包括训练是否继续低成本、推理是否继续便宜、开源边界是否保持,以及多模态、工具调用、长上下文能力能否补齐。
如果 V4 继续沿着效率路线前进,DeepSeek 将不再只是“R1 时刻”的制造者,而会变成全球 AI 产业中长期存在的技术参照系。
💬 关键观点:DeepSeek 的爆红解决了“能不能做出顶级模型”的问题,却带来了“如何长期稳定发展”的新问题。芯片、人才、商业化和政策,将共同决定它能走多远。
八、🧭 最大意义:效率路径改变 AI 竞争规则
DeepSeek 现象最大的意义,是证明 效率路径 可行。
过去两年,全球 AI 竞争几乎被一个叙事主导:谁拥有更多 GPU、更多资本、更多数据中心,谁就更接近未来。
这个叙事并没有错。算力仍然重要,资本仍然重要,基础设施仍然重要。
但 DeepSeek 补上了另一个变量:效率。
如果训练顶级模型的成本从数亿美元降到数百万美元,竞争格局会发生根本变化。更多国家、公司、研究机构和创业团队都有机会参与前沿模型研发。
这会带来三层影响。
第一,模型能力会更快普及。低成本训练与推理降低门槛,应用创新会加速。
第二,闭源巨头压力增加。开源模型如果足够强,企业客户会重新考虑是否必须绑定少数闭源 API。
第三,硬件投资逻辑更复杂。GPU 仍是核心资源,但市场会更关注单位算力产出,而不是单纯计算卡数量。
DeepSeek 不是终局答案,也不是所有公司都能复制的奇迹。它有幻方背景、人才密度、工程积累和特殊时代条件。
但它已经完成一件重要的事:让世界相信,AI 竞争不只有“烧钱堆规模”一条路。
💬 关键观点:DeepSeek 打开的不是一个模型窗口,而是一条产业路线。未来 AI 竞争会同时比拼算力规模与效率创新,谁能用更低成本释放更强能力,谁就拥有重新定义格局的机会。
🔮 趋势预判
第一,模型价格战会继续。DeepSeek V3 已经把价格锚点压到约 GPT-4o 的 1/25,其他厂商必须通过降价、差异化能力或企业服务来回应。
第二,开源模型会获得更强企业渗透。许多企业希望掌控数据与部署环境,强开源模型会推动私有化部署、本地推理和行业微调。
第三,美国芯片管制可能进一步升级,但效率创新也会同步加速。限制不会让需求消失,只会迫使团队寻找更省算力的架构。
第四,V4 会成为关键观察点。如果 DeepSeek 能持续提升能力,并保持成本优势,它将从“现象级爆红”升级为“长期竞争者”。
第五,全球 AI 格局会更分散。OpenAI、Google、Anthropic、Meta、DeepSeek 等会形成多强并立,不同路线分别代表闭源产品、开源生态、云基础设施与效率创新。
💬 关键观点:DeepSeek 之后,AI 行业不会回到原来的叙事。算力仍重要,但效率、开源和工程优化会拥有更高战略权重。
📮 今日话题
💬 如果顶级 AI 模型训练成本真的能从 数亿美元 降到 数百万美元,你认为未来更受益的是创业公司、开源社区,还是大厂云平台?
🔬 本文属于「AI 深度解析」系列,每期一个主题,追本质不追热点。
🎙️ 想听更轻松的版本?我们的每日 AI 快讯播客有更口语化的解读。
📱 关注「小敏说 AI」公众号,深度解析不水文。