2026 年回头看,几乎所有叫得出名字的视频生成模型——Sora、可灵、即梦 Seedance、HunyuanVideo、万相——主干都是同一个东西:DiT(Diffusion Transformer)。一个 2022 年 12 月挂上 arXiv 的论文(编号 2212.09748),怎么就成了整个视频生成行业的「标配发动机」?这篇用三个关键设计讲清楚。扩散本身的工作原理(加噪、去噪、采样)不展开,推荐先读本站《扩散模型入门:从噪声里「雕刻」出图像》。
问题:U-Net 好用,但不好「长大」
2023 年之前,扩散模型几乎都用 U-Net 当主干:卷积下采样压缩、再上采样还原,中间用跳跃连接保细节,配合交叉注意力注入文本条件。它对图像很称职,但有两条天花板:
- 全局关系弱。卷积是局部算子,隔得远的两个区域要叠很多层才能「看见」彼此;视频里跨帧的对象一致性恰恰是全局问题。
- 不好预测规模收益。U-Net 的结构是非标准化的(层怎么堆、分辨率怎么变,各家设计五花八门),很难像 GPT 那样说一句「参数翻倍、算力翻倍,质量按规律变好」。
而 Transformer 恰好在这两点上是强项:注意力天然全局,且架构高度规整、堆叠即可扩容。DiT 论文(William Peebles 与 Saining Xie,后发表于 ICCV 2023,目前被引已近万次)做的事,就是把扩散模型的 U-Net 主干整个换成 Transformer,并证明这条路「越大越好」。
设计一:patch 化——把图像和视频都变成 token 序列
Transformer 吃的是 token 序列,所以第一步是把连续的视觉数据切成 token。DiT 在潜在空间做这件事:图像先经 VAE 编码成潜在表示(如 256×256 图像对应 32×32×4 的 latent),再按 patch 大小 p 切块、线性嵌入成序列。p=2 时得到 256 个 token,p=8 只有 16 个——patch 越小、token 越多、计算量越大,这是 DiT 里与「加深加宽」并列的另一根扩容旋钮。
Sora 把这一步从空间推广到了时间。其 2024 年 2 月的技术报告《Video generation models as world simulators》给出三段式:先由视频压缩网络把原始视频编码到低维潜在空间,再把潜在表示切成时空 patch(spacetime latent patches),最后用 Transformer 统一处理——正如 LLM 把任意文本统一成 token。时间和空间在同一序列里被平等对待,模型这才有了「跨帧推理」的物理载体。
设计二:adaLN-Zero——时间步与条件怎么「注入」
去噪网络需要知道两件事:现在是第几步去噪(时间步 t)、用户想要什么(类别/文本条件)。DiT 论文对比了四种注入方式:把条件当额外 token(in-context)、加一路交叉注意力(cross-attention)、自适应 LayerNorm(adaLN)、以及 adaLN 的变体 adaLN-Zero。结论是 adaLN-Zero 全面最优。
它的做法是:用条件向量回归出 LayerNorm 的缩放和平移参数,并在每个残差分支上乘一个零初始化的门控 α——网络初始化时每个 block 都是恒等映射,训练从「无操作」起步逐渐放开。这既稳定了训练,又让条件对每一层的调制力度各自可学。今天的 DiT 系模型里,时间步与文本条件大多沿用这套思路的变体。
设计三:以 Gflops 为标尺的可扩展性
DiT 论文最被引用的发现是一条朴素曲线:固定其他条件,前向计算量(Gflops)越大的 DiT,FID 越低——增加深度、宽度或 token 数,收益都落在这条曲线上。DiT-XL/2 在 ImageNet 256×256 上拿到当时最优的 FID 2.27。这与 LLM 的 scaling law 遥相呼应,给视频生成吃下了定心丸:只要算力和数据跟得上,质量增长是可预期的。Sora 报告里「缩放视频生成是构建世界模拟器的有前途之路」的判断,正是这条曲线的延长线。
视频时代的变体谱系
原始 DiT 只处理单一模态序列,落到视频上各家做了演化,两条主线值得记住:
- 双流联合注意力(MM-DiT 系):文本 token 和视觉 token 各自走独立的 MLP,再在注意力层汇合做联合注意力——Stable Diffusion 3 的 MM-DiT 首先推广,腾讯 HunyuanVideo 沿用并改进为「前半双流、后半单流」的混合结构,兼顾表达能力与计算效率;阿里万相 2.2 也是 22B 参数的双流扩散 Transformer。
- 规模化与轻量化并行:HunyuanVideo 一代约 13B 参数,2025 年 12 月开源的 HunyuanVideo-1.5 用 8.3B 参数即达到官方所称的 SOTA 视觉质量与运动一致性——说明 DiT 的收益曲线仍在被继续压榨。
| 维度 | U-Net 主干 | DiT 主干 |
|---|---|---|
| 感受野 | 局部卷积逐层扩大 | 注意力一层全局 |
| 条件注入 | 多为交叉注意力 | adaLN-Zero / 联合注意力 |
| 扩容方式 | 改结构,收益难预测 | 加深度/宽度/patch 数,曲线可预期 |
| 多模态 | 旁路注入 | 文本/视觉统一为 token 序列 |
结语
DiT 的故事可以压缩成一句话:把 LLM 时代验证过的「序列 + 注意力 + 可扩展」搬进扩散模型,再把「图像序列」推广成「时空序列」。理解了 patch 化、adaLN-Zero 和 Gflops 曲线这三件事,你就拿到了读懂几乎所有视频生成技术报告的钥匙——剩下的分歧(如何编解码、如何注入音频、如何做编辑)都是在这套骨架上长出来的。至于这套骨架继续往前推,会走到「可交互的世界模拟器」哪一步,本专题第一篇已经埋了伏笔。
读者留言
COMMENTS 暂无还没有留言,来说第一句?