chapter 12 / frontier · 预计学习时间 120-150 分钟
生成图像的难点:直接学 $p(\text{图像})$ 太难(GAN 的对抗博弈不稳定,第 0 章历史课讲过它的兴衰)。扩散模型把「生成」拆成一连串微小的去噪步骤。前向过程(固定的、无参数):逐步把数据淹进高斯噪声。它有个优美的封闭式——任意时刻 $t$ 的加噪结果可以一步算出:
$$x_t = \sqrt{\bar\alpha_t}\, x_0 + \sqrt{1-\bar\alpha_t}\,\varepsilon, \qquad \varepsilon \sim \mathcal{N}(0, I)$$$\bar\alpha_t$ 从 1(无噪)单调降到 ≈0(纯噪声)。反向过程才是学习的部分:训练一个网络 $\varepsilon_\theta(x_t, t)$,看着加噪图猜出「当初混进来的噪声是什么」:
$$L = \mathbb{E}_{x_0, \varepsilon, t}\, \big\| \varepsilon - \varepsilon_\theta(x_t, t) \big\|^2$$看清楚这个损失——它就是第 1 章的 MSE 回归。整个图像生成的魔法,训练目标只是「预测噪声的回归题」:采样时从纯噪声出发,每步用预测的噪声往回退一小步,50 步后噪声变成图像。两个画龙点睛的细节:
一只 16×16 像素猫(本课程像素画主线的回归),按上面的封闭式在噪声与图像间穿行。必做实验:① 点「逆向播放」看完整轨迹——注意结构出现的顺序:先大色块轮廓、后眼睛鼻子——去噪是由粗到细的频谱过程,这就是为什么扩散模型构图能力强;② 拖到 t=45 附近——人眼已无法辨认,但 √ᾱ 还有残值,信息论上 x₀ 没死透;③ 重采样噪声再播放——同一个 x₀ 配不同 ε 走不同轨迹:训练时模型见到的就是这无穷多条 (x_t, ε) 配对。
诚实声明:这里展示的是前向公式的逆放(训练数据对长什么样);真实采样从纯噪声出发、由 ε_θ 网络一步步导航——方向相同,轨迹由模型决定。
在 1024×1024 的像素空间跑 50 步去噪,每步一次 U-Net/DiT 前向——太贵。Latent Diffusion(Stable Diffusion 的本名)先用 VAE 把图像压缩 48 倍进一个潜空间(latent space),在那里扩散,最后解码回像素。本课程的名字「潜空间实验室」至此完全回收:第 5 章词向量的语义空间、第 10 章检索的嵌入空间、这里的扩散潜空间——深度学习的统一世界观就是「把原始数据映射进一个语义有效的低维空间,在那里做一切计算」。架构上,U-Net 骨干已被 DiT(Diffusion Transformer,把加噪潜图切 patch 当 token——第 6 章架构的又一次胜利)取代,Sora 类视频模型在时空 patch 上做同样的事。
GPT-4o/Claude/Gemini 看图的机制,用前面章节拼起来只需一句话:ViT(第 4 章)把图像切 patch 编码成向量序列,一个投影层把它们对齐到 LLM 的嵌入空间,图像 token 与文本 token 拼在一起进同一个 Transformer(第 6 章)。三条路线按融合深度排:
Sora 发布时 OpenAI 的提法「视频生成模型是世界模拟器」引发了本领域最有营养的争论。正方:要把「玻璃杯坠落」生成对,模型必须隐式掌握重力、碰撞、折射——压缩视频=压缩物理(第 7 章压缩视角的极限延伸)。反方(LeCun 一派):生成像素是在学「看起来合理」,不是「物理上正确」——证据是水杯穿模、手指增殖这类系统性失误;真正的世界模型应在抽象表示空间预测(JEPA 路线),而不是在像素空间。务实派:不管哲学站谁,视频模型已在为机器人提供训练数据与策略先验(世界模型→具身智能的管道正在成型)。这场争论值得跟踪,因为它实质是在问:预测下一帧/下一词,到底能否通向理解?——你从第 7 章就开始思考的问题。
全课程评测线索的收束。读任何「SOTA」宣称前先过四道滤网:
课程主线至此完整,用三条正在展开的曲线收束(全部是前章伏笔):
第 0 章时间轴的最右端是空白的。学完这门课的你,已经有了读懂——以及参与书写——那片空白所需的全部技术基础。最后一章(第 13 章实战)会把课程所有线索拧成一个可以亲手跑通的端到端项目。