🟣 Diffusion 原理:AI 画图 / 视频的数学底层
🟣 Diffusion 原理:AI 画图 / 视频的数学底层
Midjourney、Stable Diffusion、Sora、可灵—— 这些”画图 / 出视频”的 AI 几乎全用同一套思想。 它叫 Diffusion,本质是”从噪声里雕一张画”。
🟣 AI 深度派专栏 · 第 S2-02 期 📅 2026年9月17日 ✍️ 小敏说 AI
💡 本文要点:本文讲清扩散模型(Diffusion Model)的核心思想——前向加噪 + 反向去噪、为什么它比 GAN 稳、Latent Diffusion 的工程突破,以及它如何延伸到视频。
🎯 本文导读
- 🔹 一句话理解 Diffusion
- 🔹 前向过程 + 反向过程
- 🔹 为什么比 GAN 稳
- 🔹 Latent Diffusion:让人人能跑
- 🔹 视频扩散:Sora 的秘密
一、🎨 一句话理解
Diffusion = 把一张清晰图片不断加噪声变成纯噪声(前向);学会反过来”从噪声一步步去噪”还原图片(反向)。
原图 → +噪 → +噪 → ... → 纯噪声 (正向,已知)
纯噪声 → -噪 → -噪 → ... → 新图 (反向,需要学)
💬 关键观点:生成图的本质是”反向去噪”。一张新图,就是从纯噪声开始一步步雕出来的。
二、📐 前向过程(已知 / 简单)
每一步给图加一点高斯噪声:
x_t = √(α_t) · x_{t-1} + √(1-α_t) · ε
经过 T 步(通常 1000),图变成纯噪声 N(0, I)。
为什么这有用:前向过程完全可计算、不需要学,但它给反向过程提供了配对训练数据。
三、🔁 反向过程(需要学)
训练一个神经网络 ε_θ,输入”含噪图 + 时间步 t”,预测这一步加进去的噪声。
loss = || ε - ε_θ(x_t, t) ||²
✅ 推理时:从纯噪声出发,反复调用网络预测噪声 → 减去 → 得到下一步更干净的图。
🎯 一句话总结:Diffusion 的网络不是”画图的”,是”猜噪声的”。猜得越准,画得越像。
四、⚖️ 为什么比 GAN 稳
| 维度 | GAN | Diffusion |
|---|---|---|
| 训练 | 两个网络对抗,不稳 | 单一 loss,稳 |
| 样本多样性 | 容易”模式崩溃” | 自然多样 |
| 可控性 | 难 | 天然支持 prompt / 条件 |
| 速度 | 一次 forward | 多步 forward(慢) |
⚠️ 重要提醒:Diffusion 的代价是速度慢——20-50 步 forward 才能出一张。所以才有了 LCM、Turbo、Distillation 等”少步采样”研究。
五、⚡ Latent Diffusion:让人人能跑
直接在 1024×1024 像素上做 Diffusion,计算量爆炸。
Stable Diffusion 的关键突破:
1. 用 VAE 把图压成 64×64 的"潜空间"
2. 在潜空间里做 Diffusion(计算量降 16-64 倍)
3. 最后用 VAE 解码回像素
✅ 这就是 Latent Diffusion Model(LDM)——让消费级显卡也能跑文生图的根本原因。
六、🎬 视频扩散:Sora 的秘密
视频 = 时间 × 高 × 宽 的 4D 张量。直接做 Diffusion 会爆。
Sora 的两大创新
- Spacetime Patch:把视频切成”时空小方块”,像 Token 一样处理
- Diffusion Transformer (DiT):用 Transformer 替代 UNet 作为去噪网络
💬 关键观点:Sora 本质上是”时空 Token + DiT + Diffusion” 三者合体。
七、🎯 文 / 图 / 音 怎么”条件控制”
| 模态 | 方式 |
|---|---|
| 文本 | Cross-Attention 把 prompt 注入每一步去噪 |
| 图像 | ControlNet / IP-Adapter |
| 音频 | 把音频特征作为条件 |
| 深度 / 边缘 | 多种 ControlNet 同时控 |
八、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ Diffusion 在”画”图 | ✅ 是在”去噪” |
| ❌ Diffusion 就是 GAN 升级 | ✅ 思想完全不同 |
| ❌ 1 步就能出图 | ✅ 通常 20-50 步(除非蒸馏) |
| ❌ Diffusion 只能画图 | ✅ 视频、音频、3D 都能 |
九、🎁 给非数学读者的”Diffusion 心法”
🔑 一张图 = 一组高斯噪声 + 一连串去噪步骤
🔑 网络学的是"猜噪声",不是"画图"
🔑 LDM 把它降到消费级显卡
🔑 DiT 让它扩展到视频、3D、未来更多模态
📮 今日话题:你用过最多的”扩散模型出品”,是 Midjourney、SD 还是 Sora?
🔮 下一篇预告:s2ep03《推理模型:o1 / R1 / 思考链是什么新物种》
🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-02 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。