chapter 12 / frontier · 预计学习时间 120-150 分钟

多模态与前沿
潜空间到未竟之地

AUDIO // 本章语音导读
本章目录
  1. 扩散模型:往回走的热力学
  2. 交互实验室:50 步去噪
  3. 从像素到潜空间:课程名字的回收
  4. 多模态 LLM:把一切变成 token
  5. 世界模型之争
  6. 评估方法论:测什么、怎么信
  7. 安全与可解释性前沿
  8. 三条未尽的曲线
  9. 章节测验

扩散模型:往回走的热力学

生成图像的难点:直接学 $p(\text{图像})$ 太难(GAN 的对抗博弈不稳定,第 0 章历史课讲过它的兴衰)。扩散模型把「生成」拆成一连串微小的去噪步骤。前向过程(固定的、无参数):逐步把数据淹进高斯噪声。它有个优美的封闭式——任意时刻 $t$ 的加噪结果可以一步算出:

$$x_t = \sqrt{\bar\alpha_t}\, x_0 + \sqrt{1-\bar\alpha_t}\,\varepsilon, \qquad \varepsilon \sim \mathcal{N}(0, I)$$

$\bar\alpha_t$ 从 1(无噪)单调降到 ≈0(纯噪声)。反向过程才是学习的部分:训练一个网络 $\varepsilon_\theta(x_t, t)$,看着加噪图猜出「当初混进来的噪声是什么」:

$$L = \mathbb{E}_{x_0, \varepsilon, t}\, \big\| \varepsilon - \varepsilon_\theta(x_t, t) \big\|^2$$

看清楚这个损失——它就是第 1 章的 MSE 回归。整个图像生成的魔法,训练目标只是「预测噪声的回归题」:采样时从纯噪声出发,每步用预测的噪声往回退一小步,50 步后噪声变成图像。两个画龙点睛的细节:

交互实验室:50 步去噪

一只 16×16 像素猫(本课程像素画主线的回归),按上面的封闭式在噪声与图像间穿行。必做实验:① 点「逆向播放」看完整轨迹——注意结构出现的顺序:先大色块轮廓、后眼睛鼻子——去噪是由粗到细的频谱过程,这就是为什么扩散模型构图能力强;② 拖到 t=45 附近——人眼已无法辨认,但 √ᾱ 还有残值,信息论上 x₀ 没死透;③ 重采样噪声再播放——同一个 x₀ 配不同 ε 走不同轨迹:训练时模型见到的就是这无穷多条 (x_t, ε) 配对。

diffusion.forward_process(x₀, t)

诚实声明:这里展示的是前向公式的逆放(训练数据对长什么样);真实采样从纯噪声出发、由 ε_θ 网络一步步导航——方向相同,轨迹由模型决定。

VIDEO 01
But how do AI images & videos actually work?(AI 图像视频到底怎么工作)
Welch Labs × 3Blue1Brown 合作 37:32
观看指南 · §1-§3 的最佳影像版
  • 05:00 前向加噪与反向去噪的可视化——实验室的高维真身。
  • 14:00 CLIP 如何连接文字与图像空间(第 0 章节点的深讲)。
  • 24:00 CFG 引导强度的几何解释——w 调大为什么会「过饱和」。

从像素到潜空间:课程名字的回收

在 1024×1024 的像素空间跑 50 步去噪,每步一次 U-Net/DiT 前向——太贵。Latent Diffusion(Stable Diffusion 的本名)先用 VAE 把图像压缩 48 倍进一个潜空间(latent space),在那里扩散,最后解码回像素。本课程的名字「潜空间实验室」至此完全回收:第 5 章词向量的语义空间、第 10 章检索的嵌入空间、这里的扩散潜空间——深度学习的统一世界观就是「把原始数据映射进一个语义有效的低维空间,在那里做一切计算」。架构上,U-Net 骨干已被 DiT(Diffusion Transformer,把加噪潜图切 patch 当 token——第 6 章架构的又一次胜利)取代,Sora 类视频模型在时空 patch 上做同样的事。

多模态 LLM:把一切变成 token

GPT-4o/Claude/Gemini 看图的机制,用前面章节拼起来只需一句话:ViT(第 4 章)把图像切 patch 编码成向量序列,一个投影层把它们对齐到 LLM 的嵌入空间,图像 token 与文本 token 拼在一起进同一个 Transformer(第 6 章)。三条路线按融合深度排:

世界模型之争

Sora 发布时 OpenAI 的提法「视频生成模型是世界模拟器」引发了本领域最有营养的争论。正方:要把「玻璃杯坠落」生成对,模型必须隐式掌握重力、碰撞、折射——压缩视频=压缩物理(第 7 章压缩视角的极限延伸)。反方(LeCun 一派):生成像素是在学「看起来合理」,不是「物理上正确」——证据是水杯穿模、手指增殖这类系统性失误;真正的世界模型应在抽象表示空间预测(JEPA 路线),而不是在像素空间。务实派:不管哲学站谁,视频模型已在为机器人提供训练数据与策略先验(世界模型→具身智能的管道正在成型)。这场争论值得跟踪,因为它实质是在问:预测下一帧/下一词,到底能否通向理解?——你从第 7 章就开始思考的问题。

评估方法论:测什么、怎么信

全课程评测线索的收束。读任何「SOTA」宣称前先过四道滤网:

  1. 污染了吗?(第 1 章纪律 → 第 7 章去污染)静态 benchmark 会泄入训练数据——MMLU 高分可能是背题。对策:LiveBench 式动态出题、私有测试集。
  2. 测的是能力还是偏好? LMArena 的 Elo 是「人类更喜欢谁」——会奖励自信的语气和漂亮的格式(第 8 章谄媚的回声)。偏好≠正确。
  3. 单点还是分布? 第 11 章 pass^k:报告「跑一次的最好成绩」与「无人值守的稳定成绩」是两个世界。
  4. 古德哈特了吗?(第 8 章定律的评估版)当 SWE-bench 成为优化目标,模型可能在学「解 SWE-bench」而不是「软件工程」。任何指标被瞄准后都会通胀——所以前沿实验室内部都维护不公开的评测。
个人/团队的实操结论(第 8 章方法论的收尾):公共 benchmark 用来粗筛模型,自己的任务必须自建评测——几十条精标样例 + 程序化校验,胜过任何排行榜。你的评测集是你最私有的资产之一。

安全与可解释性前沿

三条未尽的曲线

课程主线至此完整,用三条正在展开的曲线收束(全部是前章伏笔):

  1. Scaling 的接力:预训练幂律放缓(第 7 章 data wall)→ 接力棒传给 RL 后训练(第 8 章 RLVR:用算力换数据效率)与推理时计算(o1/R1:思考更久)。「算力买智能」仍在继续,只是买的方式变了。
  2. 从对话到长时程 Agent(第 11 章的延长线):可靠性工程(pass^k)、记忆与 skills 沉淀、多 Agent 协作——竞争焦点从「模型多聪明」转向「系统能连续工作多久不翻车」。
  3. 多模态到具身:视频世界模型 → 机器人 VLA(视觉-语言-动作)模型——「下一词预测」的配方正在被搬进物理世界。

第 0 章时间轴的最右端是空白的。学完这门课的你,已经有了读懂——以及参与书写——那片空白所需的全部技术基础。最后一章(第 13 章实战)会把课程所有线索拧成一个可以亲手跑通的端到端项目。

章节测验