🟣 Diffusion 原理:AI 画图 / 视频的数学底层

Midjourney、Stable Diffusion、Sora、可灵—— 这些”画图 / 出视频”的 AI 几乎全用同一套思想。 它叫 Diffusion,本质是”从噪声里雕一张画”。

🟣 AI 深度派专栏 · 第 S2-02 期 📅 2026年9月17日 ✍️ 小敏说 AI

💡 本文要点:本文讲清扩散模型(Diffusion Model)的核心思想——前向加噪 + 反向去噪、为什么它比 GAN 稳、Latent Diffusion 的工程突破,以及它如何延伸到视频。


🎯 本文导读

  • 🔹 一句话理解 Diffusion
  • 🔹 前向过程 + 反向过程
  • 🔹 为什么比 GAN 稳
  • 🔹 Latent Diffusion:让人人能跑
  • 🔹 视频扩散:Sora 的秘密

一、🎨 一句话理解

Diffusion = 把一张清晰图片不断加噪声变成纯噪声(前向);学会反过来”从噪声一步步去噪”还原图片(反向)。

原图 → +噪 → +噪 → ... → 纯噪声   (正向,已知)
纯噪声 → -噪 → -噪 → ... → 新图     (反向,需要学)

💬 关键观点:生成图的本质是”反向去噪”。一张新图,就是从纯噪声开始一步步雕出来的。


二、📐 前向过程(已知 / 简单)

每一步给图加一点高斯噪声:

x_t = √(α_t) · x_{t-1} + √(1-α_t) · ε

经过 T 步(通常 1000),图变成纯噪声 N(0, I)。

为什么这有用:前向过程完全可计算、不需要学,但它给反向过程提供了配对训练数据。


三、🔁 反向过程(需要学)

训练一个神经网络 ε_θ,输入”含噪图 + 时间步 t”,预测这一步加进去的噪声。

loss = || ε - ε_θ(x_t, t) ||²

✅ 推理时:从纯噪声出发,反复调用网络预测噪声 → 减去 → 得到下一步更干净的图。

🎯 一句话总结:Diffusion 的网络不是”画图的”,是”猜噪声的”。猜得越准,画得越像。


四、⚖️ 为什么比 GAN 稳

维度 GAN Diffusion
训练 两个网络对抗,不稳 单一 loss,稳
样本多样性 容易”模式崩溃” 自然多样
可控性 难 天然支持 prompt / 条件
速度 一次 forward 多步 forward(慢)

⚠️ 重要提醒:Diffusion 的代价是速度慢——20-50 步 forward 才能出一张。所以才有了 LCM、Turbo、Distillation 等”少步采样”研究。


五、⚡ Latent Diffusion:让人人能跑

直接在 1024×1024 像素上做 Diffusion,计算量爆炸。

Stable Diffusion 的关键突破:

1. 用 VAE 把图压成 64×64 的"潜空间"
2. 在潜空间里做 Diffusion(计算量降 16-64 倍)
3. 最后用 VAE 解码回像素

✅ 这就是 Latent Diffusion Model(LDM)——让消费级显卡也能跑文生图的根本原因。


六、🎬 视频扩散:Sora 的秘密

视频 = 时间 × 高 × 宽 的 4D 张量。直接做 Diffusion 会爆。

Sora 的两大创新

  1. Spacetime Patch:把视频切成”时空小方块”,像 Token 一样处理
  2. Diffusion Transformer (DiT):用 Transformer 替代 UNet 作为去噪网络

💬 关键观点:Sora 本质上是”时空 Token + DiT + Diffusion” 三者合体。


七、🎯 文 / 图 / 音 怎么”条件控制”

模态 方式
文本 Cross-Attention 把 prompt 注入每一步去噪
图像 ControlNet / IP-Adapter
音频 把音频特征作为条件
深度 / 边缘 多种 ControlNet 同时控

八、❌ 常见误区

误区 真相
❌ Diffusion 在”画”图 ✅ 是在”去噪”
❌ Diffusion 就是 GAN 升级 ✅ 思想完全不同
❌ 1 步就能出图 ✅ 通常 20-50 步(除非蒸馏)
❌ Diffusion 只能画图 ✅ 视频、音频、3D 都能

九、🎁 给非数学读者的”Diffusion 心法”

🔑 一张图 = 一组高斯噪声 + 一连串去噪步骤
🔑 网络学的是"猜噪声",不是"画图"
🔑 LDM 把它降到消费级显卡
🔑 DiT 让它扩展到视频、3D、未来更多模态

📮 今日话题:你用过最多的”扩散模型出品”,是 Midjourney、SD 还是 Sora?

🔮 下一篇预告:s2ep03《推理模型:o1 / R1 / 思考链是什么新物种》


🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-02 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。