← Home

Wan: Open and Advanced Large-Scale Video Generative Models

Team Wan(Wan Team, Alibaba Group;§7 Contributors 按名字母序共 62 位作者,arXiv 显示 'Team Wan and 61 other authors') · Alibaba Group · 2025-04-19 · arXiv:2503.20314

Wan 2.1:VBench 86.22% 压过 Sora 的开源视频模型,强在工程、弱在机制

> 量子位技术拆解 · 公式前后都给你直觉。完整结构化数据见「速查」tab。

2025 年初,阿里开源的 Wan 2.1(arXiv 2503.20314,60 页)在公开 VBench 榜上拿 86.22%,压过 Sora 的 84.28%,还顺手把 1.3B 小模型做到 8.19 GB 显存可跑。这份报告值得读的地方,在于它示范了一套系统级的工程范式:每一个大设计都对应一个可观测的训练/推理现象,但几乎没有一个被机制化检验——因果 3D VAE、全时空注意力 DiT、flow matching 课程训练、滑动窗口、缓存、量化,链条完整,机制层缺席。我们从头拆。

先看现象:注意力成本、chunk 边界、采样步冗余

视频生成的第一个工程瓶颈是注意力开销。Wan 的主干是 DiT,序列长度来自 VAE 的时空压缩:一个 $(1+T)\times H\times W\times 3$ 的视频,被压成 $[1+T/4,\, H/8,\, W/8,\, 16]$ 的 latent,再经 patchify(3D 卷积核 $(1,2,2)$)展成 token 序列。论文给的 DiT 成本模型是:

$$C = L\big(\alpha b s h^2 + \beta b s^2 h\big)$$

$L$ 是层数,$b$ 是 micro-batch,$s$ 是序列长度,$h$ 是隐层维度;$\alpha$ 项对应线性层(随 $s$ 线性),$\beta$ 项对应注意力(随 $s^2$ 二次增长),非因果注意力下 $\beta$ 前向取 4、反向取 8。代入实际规模:序列到 1M token 时,注意力占端到端训练时间高达 95%(§4.3.1, p15)。这个数字解释了报告里几乎每一个设计选择——为什么 VAE 要压缩、为什么要缓存、为什么要滑动窗口。

第二个可观测现象在 VAE 的推理路径:逐 chunk 编码/解码长视频时,若 chunk 之间不维持特征缓存,chunk 边界会失去时序连续性(§4.1.3, p11-12);因果卷积核为 3 时只需缓存前一个 chunk 末尾 2 帧、2× 时序下采样时缓存 1 帧,就能保证任意长度视频的稳定推理。第三个现象在采样侧:同一 DiT block 内不同采样步的 attention 输出高度相似,CFG 采样后期条件/无条件输出也相似(§4.4.2, p18)——这是后面 diffusion cache 1.62× 加速的直接依据。第四个现象偏负例:TensorRT 量化会引入可测量的闪烁与时序不连贯(§5.6.3, p44),而 flicker 本身没有直接量化指标,只有像素级稳定性这类 proxy(§4.6, p20-21)。

数据侧还有一组容易漏掉的观测。预训练阶段,抖动镜头、静态访谈类视频、低质运动数据会被系统剔除或降采样,因为作者发现它们损害运动生成质量(§3.1, p6);合成图像污染小于 10% 就会显著降性能,因此专门训练分类器过滤「污染」图——数据管线直接砍掉约 50% 的初始数据。caption 侧,自家模型用 slow-fast 编码(每 4 帧保原始分辨率、其余帧做全局池化)把 VideoMME 无字幕准确率从 67.6% 抬到 69.1%(§3.3.3, p9),整体 F1 与 Gemini 1.5 Pro 相当。这些负例与工程观测,比正向叙事更接近可检验的「现象」——合成污染、量化退化、因果注意力不适配,都是可以被复现的取舍。

机制假设:五条设计理由,没有一条被当假说检验

报告给的是五条设计理由,没有一条被当作可证伪机制检验:时序因果性——未来帧不影响过去帧是真实连贯视频的关键,所以 VAE 用 3D 因果卷积 + RMSNorm(替换 GroupNorm)保因果(§4.1, p10);双向注意力适合扩散——decoder-only 因果注意力不适配扩散文本条件注入,所以文本编码器选双向的 umT5(观察承自 HunyuanVideo,§4.7.2, p25);局部时序依赖——时序依赖局限在有限窗口,所以 Streamer 用滑动窗口就能维持连续性(§5.6.2, p42);跨步注意力冗余——不同采样步输出相似,所以可以缓存复用(§4.4.2, p18);深度优于 AdaLN 参数量——同参数下加深层数比加大 AdaLN 更有效(§4.7.2, p24)。

支持证据大多是工程收益而非机制验证:feature cache 让任意长视频不出现边界断裂;umT5 在 T2I 上 FID 43.01,优于 Qwen-VL-7B 末层特征的 43.72(但略差于其倒数第二层的 42.91,Table 6, p25);Streamer 在 8 张 A100 上以 8 FPS 实时生成 15 分钟视频(Fig. 30, p42);diffusion cache 带来 1.62×;四种 AdaLN 配置里 Full-shared-AdaLN-1.5B(35 层)训练 loss 最低,胜过参数更多的 Non-shared-AdaLN-1.7B(30 层,Fig. 16, p24)。注意这最后一条是全报告最接近「消融」的实验——但只到训练 loss 级。

Figure 16:四种 AdaLN 配置的训练 loss 曲线——Full-shared-AdaLN-1.5B(35 层)收敛最好

备选解释在报告里基本没被隔离:时序一致性收益没有「因果 vs 双向」的 VAE/注意力 A/B 消融,因果性可能只是压缩率或训练便利的副产品;双向注意力的优势可能来自 umT5 的预训练规模而非注意力方向(作者没做同规模同预训练的方向对照);端到端 SOTA 可能主要由数据规模(数十亿图文、O(1) 万亿 token)与课程训练驱动;Streamer 窗口大小 $w = T$ 的选择没有消融。换句话说,机制→干预这一环在这份报告里是缺席的,而不是薄弱

干预与形式化:flow matching 课程 + 组件级手术

机制缺席不耽误工程。训练侧的形式化是 flow matching(Rectified Flow 线性插值 + logit-normal 采样 $t$ + MSE 速度损失):

$$x_t = t\,x_1 + (1-t)\,x_0, \qquad v_t = \frac{dx_t}{dt} = x_1 - x_0$$

$$\mathcal{L} = \mathbb{E}_{x_0, x_1, c_{txt}, t}\big[\|u(x_t, c_{txt}, t; \theta) - v_t\|^2\big]$$

$x_1$ 是真实视频 latent,$x_0 \sim \mathcal{N}(0, I)$ 是噪声,$t\in[0,1]$ 按 logit-normal 分布采样,$x_t$ 是两者的线性插值;$v_t = x_1 - x_0$ 是插值路径的匀速速度场,模型 $u(\cdot; \theta)$ 学的是预测这个速度,$c_{txt}$ 是 umT5 的 512 token 文本嵌入。训练分四阶段课程:先 256px 的 T2I 预训练对齐语义与几何,再 192px/16fps/5 秒视频与图联合,然后 480px、720px 逐级上分辨率(§4.2.2, p14-15)——这样避开「高分辨率 + 长时序联合训练」导致的吞吐骤降与梯度方差尖峰。

组件级干预选四个有数字的。Wan-VAE(127M 参数):3D 因果卷积 + 时序下采样 + feature cache,200 个 720×720/25 帧视频上 PSNR≈38 全场最高、效率约 6 frame/latency,重建速度 2.5× HunyuanVideo(Fig. 7, p12):

Figure 7:VAE 重建质量(PSNR)× 效率散点——Wan-VAE 127M 落在右上角,PSNR≈38 且比 HunyuanVideo 快 2.5×

DiT 主干:全时空自注意力(非分窗、非 U-ViT——U-ViT 只是 related work 里 Mochi 的主干)+ 交叉注意力注入 umT5 + 共享时间嵌入 MLP(各 block 只学 bias,参数 −25%)。推理优化:diffusion cache 1.62×、FP8 GEMM 1.13×、8-bit FlashAttention 1.27×(H20 上 95% MFU,混合 int8/FP8 + FP32 跨块累加,FA3 原生 FP8 在视频上质量明显退化)。Streamer + LCM 蒸馏:滑动去噪窗口 + 缓存 token 以噪声 0 重注入 + 4 步一致性模型,10–20× 加速、8–16 FPS 渲染,单张 4090(int8 + TensorRT)8 FPS、演示 20 FPS(§5.6.3, p44)。整条主干的架构图就是 Figure 9——它是全文所有干预的挂载点:

Figure 9:Wan 整体架构——Wan-VAE 编码 → 全时空注意力 DiT(umT5 交叉注意力 + 时间步调制)→ 解码回像素

收益与最弱一环

端到端收益全部带外部基线:VBench 86.22%(visual 86.67 / semantic 84.44)vs Sora 84.28%、MiniMax 83.41%、Hunyuan 83.24%(Table 4, p23);自建 Wan-Bench 加权分 0.724 vs Sora 0.700(每模型 1,035 样本、5,000+ 对人工偏好加权,Table 2, p21);700+ 任务人工评测里 overall ranking 对 Runway 胜率 67.6%(Table 3, p23)。1.3B 小模型 VBench 83.96% 也超过 Hunyuan 与 Kling,显存只要 8.19 GB。但归因边界报告自己也守不住:VBench 数字是自报口径,Wan-Bench 是自建评测,数据与算力规模不披露,端到端分数无法分离到任何一个单一设计。

另有几个自对照值得记录:VAE 比 VAE-D(重建 loss 换扩散 loss)在 T2I 上 FID 全面更低(15k 步 40.55 vs 41.16,Table 5, p25);推理期用 Qwen2.5-Plus 把用户 prompt 改写成训练 caption 的分布(加细节不改语义、补自然动作、按「风格→内容摘要→细节」结构),在 Wan-Bench 上有提升但报告没给具体增益数字(§4.5, p19-20)。

最弱一环是机制到干预的推导链:报告从不宣称机制,干预全部来自工程观察复用(HunyuanVideo 的双向注意力观察、DiT 主流范式、流匹配框架),因果性、窗口依赖、跨步冗余三条假设都没有对照实验隔离;消融只到 1.3B 模型的训练 loss/FID 级(AdaLN 四种配置、文本编码器三选一、VAE vs VAE-D),无 seed 方差、无显著性检验。这是一份诚实的工程报告:收益数字可信,机制叙事空缺——读它时把「设计理由」和「已验证因果」分开记账。

一句话记住这篇

Wan 2.1 是「可观测设计选择 → 工程干预」的样板:注意力成本(1M token 占训练 95%)、chunk 边界断裂、跨步注意力冗余、量化闪烁,每个现象都有对应干预(因果 VAE + feature cache、全时空 DiT、diffusion cache、混合精度),端到端 VBench 86.22% 压过 Sora 的 84.28%;但机制假设一条都没有被当作可证伪命题检验,最弱一环是「机制→干预」的缺席。最该记住的数字:因果卷积核为 3 时,跨 chunk 只需缓存前 2 帧,就能支持无限长视频稳定推理——时序一致性的工程化,往往只需要一个很小的状态。

Wan 2.1 是系统级视频生成技术报告:以『因果 3D VAE + 全时空注意力 DiT + flow matching 分阶段课程训练』为设计主干,把时序一致性、长视频上下文、双向 vs 单向注意力等可观测设计选择转成工程干预并给出端到端收益(VBench 86.22%、Wan-Bench 0.724、VAE 提速 2.5×、LCM 10–20×);但机制层解释多为设计理由而非可证伪假设,『机制→干预』一环全程缺对照,是典型『强工程、弱机制』的闭环。

闭环(Observation → Mechanism → Intervention → Gain)

① 可观测现象

观测到什么:三类可观测现象:(1) 时序类——『未来帧不应影响过去帧』被作者视为生成真实连贯视频的关键约束(§4.1, p10);传统 DiT 受注意力长时序开销限制只能生成几秒视频(§5.6.2, p40);TensorRT 量化在部分情况引入可测量的不稳定——闪烁(flickering)与时序不连贯(§5.6.3, p44);VAE 长视频逐 chunk 编码/解码时若不在 chunk 间维持特征缓存,会在 chunk 边界失去时序连续性(§4.1.3, p11-12)。(2) 注意力方向类——decoder-only LLM 的因果注意力作为扩散文本编码器表现不佳,双向注意力的 umT5 收敛更快、组合性更好(§4.7.2, p25,观察承自 HunyuanVideo);同一 DiT block 内不同采样步的 attention 输出高度相似、采样后期条件/无条件输出相似(§4.4.2, p18)。(3) 数据/训练动态类——高分辨率+长时序联合训练导致吞吐骤降与梯度方差尖峰(§4.2.2, p14);抖动镜头、静态视频、低质运动数据损害运动生成质量(§3.1, p6);合成图像污染 <10% 即显著降性能(§3.1, p6);I2V 首帧与内容差异大时模型难以学到稳定的图生视频(§5.1.2, p27)。

在哪里观测:贯穿 T2V/I2V/编辑/个性化/实时/音频共 8 个任务;核心设置:Wan-VAE(127M 参数,4×8×8 时空压缩,latent C=16,§4.1.1, p10)、Wan 1.3B/14B DiT、umT5 文本编码器;评测在自建 Wan-Bench(每模型 1,035 样本)、公开 VBench、200 个 720×720/25 帧重建集、700+ 人工评测任务上进行(§4.6-4.7, p20-23)。

如何量化:现象大多以『设计动机+定性描述』呈现,量化集中在端到端指标:Wan-Bench 14 维自动评分 + 5,000+ 对人工偏好加权(§4.6, p21);VBench 16 维公开榜(Table 4, p23);VAE 用 PSNR×效率散点(200 视频,Fig 7, p12);caption 模型用 CAPability 协议 F1(10 维 × 1,000 视频,Fig 4, p9);实时性用 FPS(Fig 30/31, p42)。注意:flicker/时序一致性等关键现象本身没有直接量化指标,只有『像素级稳定性』(静态区帧间差)等 proxy(§4.6, p20-21)。

② 机制假设

假设:报告给的是设计理由而非可证伪机制假设,主要五条:(1) 时序因果性——未来帧不影响过去帧是生成真实连贯视频的关键,故 VAE 采用 3D 因果卷积 + RMSNorm(替换 GroupNorm)保证因果性(§4.1, p10;§4.1.1, p10);(2) 双向注意力适合扩散——decoder-only 因果注意力不适合扩散文本条件注入,双向 umT5 的组合性与收敛更优(§4.7.2, p25,观察承自 HunyuanVideo 并复用其 bidirectional token refiner 策略);(3) 局部时序依赖假设——时序依赖局限在有限时间窗口内,故 Streamer 用滑动窗口即可维持视频连续性(§5.6.2, p42);(4) 跨步注意力冗余——不同采样步 attention 输出相似 + CFG 后期条件/无条件输出相似,故可缓存复用(§4.4.2, p18);(5) 深度优于 AdaLN 参数量——同参数下加深层数比加大 AdaLN 更有效(§4.7.2, p24)。

证据

  • 因果性设计的工程收益:RMSNorm + feature cache 使任意长视频 chunk 推理不产生边界断裂、支持无限长稳定推理(§4.1.3, p11-12);VAE 重建速度 2.5× HunyuanVideo(§4.1.4, p12)。
  • 双向注意力:umT5 在 T2I 任务 FID 43.01,优于 Qwen-VL-7B 末层 43.72(但次于其倒数第二层 42.91);给 Qwen2.5/GLM-4 加双向 token refiner 适配层后训练损失与可视化仍不如 umT5(§4.7.2, Table 6, p25)。
  • 滑动窗口:Streamer 在 8 A100 上实时 8 FPS 生成 15 分钟视频(Fig 30, p42);单 4090 + int8/TensorRT 演示 20 FPS(Fig 31, p42)。
  • 跨步冗余:diffusion cache 给 14B T2V 带来 1.62× 推理加速(§4.4.2, p18)。
  • 深度>参数:Full-shared-AdaLN-1.5B(35 层)训练 loss 最低,胜过参数更多的 Non-shared-AdaLN-1.7B(30 层)(Fig 16, p24)。

备选解释

  • 时序一致性/生成质量收益未隔离到因果设计:无『因果 vs 双向』VAE 或注意力的 A/B 消融,因果性可能只是压缩率/训练便利的副产品(§4.7.2 仅做 VAE vs VAE-D 损失项消融)。
  • 双向注意力优势可能来自 umT5 的预训练质量/规模而非注意力方向本身——作者未做同规模同预训练下的方向对照,『双向适合扩散』是借来的假设。
  • 端到端 SOTA 收益可能主要由数据规模(数十亿图文、O(1) 万亿 token)与课程训练驱动,而非任何单个设计选择;且评测部分为自建(Wan-Bench)或自报(VBench 口径),有选择性风险(§4.6, p20-21)。
  • Streamer 的『局部窗口依赖』假设未被检验:窗口大小 w=T 的选择无消融,也不清楚窗口外信息被截断的代价。

形式化/toy model:工程层形式化存在:flow matching 目标 xt = tx1 + (1−t)x0、vt = x1 − x0、MSE 速度损失(Eq. 1-3, §4.2.2, p14);DiT 计算成本模型 L(αbsh² + βbs²h),非因果注意力 β=4(前向)/8(反向),1M token 时 attention 占训练时间高达 95%(§4.3.1, p15)。机制层形式化(如因果注意力如何产生时序一致性的理论刻画、窗口大小的信息论依据、双向注意力为何利于扩散)不存在——标 null。

③ 局部干预

干预对象:Wan-VAE(图 5-6)

操作:3D 因果卷积 + 时序 2× 下采样;GroupNorm→RMSNorm(『保时序因果性』);首帧仅空间压缩(沿用 MagViT-v2);空间上采样层输入通道减半(推理内存 −33%);feature cache(chunk 化推理:1+T/4 个 chunk、每 chunk ≤4 帧,因果卷积核 3 时缓存前 chunk 末 2 帧、2× 时序下采样时缓存 1 帧,初始 chunk 零填充);127M 参数;三阶段训练:2D 图像 VAE→inflate 为 3D 因果 VAE→128×128/5 帧低分辨率训练→高质量微调 + 3D 判别器 GAN loss(损失 L1×3 + KL×3e-6 + LPIPS×3)(§4.1.1-4.1.2, p10-11)

效果:200 视频 720×720/25 帧评测中 PSNR≈38 为全场最高、效率约 6 frame/latency(Fig 7, p12);重建速度 2.5× HunyuanVideo(§4.1.4, p12);支持任意长视频稳定推理(§4.1.3, p11)

局部性:干预严格限定在 VAE 内部,DiT 完全不变;因果性与长视频能力以『架构约束』层面注入,属组件级而非机制级定位

干预对象:DiT 主干(§4.2.1, p14)

操作:全时空自注意力(非分窗、非 U-ViT——U-ViT 仅出现在 related work 对 Mochi 的描述里,§2, p5);交叉注意力注入 umT5 条件;共享时间嵌入 MLP(预测 6 个调制参数,各 block 只学 bias,参数 −25%);patchify 3D 卷积核 (1,2,2),序列长 L=(1+T/4)×H/16×W/16

效果:无单独量化(与数据规模、课程训练捆绑在端到端结果里);25% 参数节省有消融旁证(Full-shared-AdaLN 训练 loss 对比,Fig 16, p24)

局部性:全局架构选择,无注意力形式 A/B 消融

干预对象:训练课程与优化(§4.2.2, p14-15)

操作:flow matching(Rectified Flow 线性插值、logit-normal 采样 t、MSE 速度损失)+ 四阶段课程:256px T2I 预训练→(256px 图 + 192px/16fps/5s 视频)→480px→720px;bf16 混合精度、AdamW wd=1e-3、lr=1e-4、按 FID/CLIP Score 平台期降 lr

效果:端到端 SOTA(VBench 86.22% 等),但每阶段增益未单独消融

局部性:训练协议级干预,覆盖全部模块,无法归因到单一设计

干预对象:Streamer 滑动窗口 + LCM 蒸馏(§5.6.2-5.6.3, p40-44)

操作:2w 个 token 的训练序列(w=窗口=扩散步数 T),前 w 个仅 warmup 不计 loss;推理用去噪队列滑动:最左 token 出队缓存、新噪声 token 入队;缓存 token 以噪声 0 重新入队保证窗口间连续性;再以 Latent Consistency Model 蒸馏成 4 步一致性模型

效果:10–20× 推理加速、8–16 FPS 渲染(§5.6.3, p44);8 A100 实时 8 FPS 生成 15 分钟视频(Fig 30, p42);单 4090 int8+TensorRT 8 FPS/演示 20 FPS(§5.6.3, p44;Fig 31, p42)

局部性:从预训练模型微调(主干权重继承);窗口大小 w=T 无消融

干预对象:推理优化(§4.4.2-4.4.3, p18-19;§5.6.3, p44)

操作:diffusion cache(跨步 attention 缓存 + CFG 跨步缓存 + 残差补偿);FP8 GEMM(per-tensor 权重/per-token 激活);8-bit FlashAttention(S=QK^T 用 int8、O=PV 用 FP8、跨块 FP32 累加 + block size 调优);int8(torchao) + TensorRT 量化

效果:diffusion cache 1.62×;FP8 GEMM 1.13×(DiT 模块,相对 BF16 GEMM 2×);8-bit FA 1.27×、H20 上 95% MFU;代价是 TensorRT 引入 flickering/时序不连贯(§5.6.3, p44)

局部性:推理管线级,训练权重不变

干预对象:推理期 prompt 改写(§4.5, p19-20)

操作:Qwen2.5-Plus 按训练 caption 分布改写用户 prompt(加细节不改语义、补自然动作、按『风格→内容摘要→细节』三段式结构),并给每图像/视频配多风格多长度 caption

效果:Wan-Bench 上提升(Table 1 示例;具体增益数字未给)

局部性:纯推理期,模型权重零改动

因果验证:弱。报告以系统级评测 + 少量模块级消融为主:AdaLN 四种配置训练 loss 曲线(Fig 16, p24)、文本编码器三选一(Fig 17 + Table 6, p25)、VAE vs VAE-D 损失项(Table 5, p25)——全部是 1.3B 模型上『训练损失/FID 级』对比,无 seed 方差、无逐干预归因、无因果/双向注意力 A/B、无窗口大小消融;端到端数字(VBench/Wan-Bench/人工评测)无法分离到任何单一设计选择。

④ 工程收益

指标:VBench 总分

数值:86.22%(visual 86.67 / semantic 84.44)

基线:Sora 84.28%、MiniMax-Video-01 83.41%、Hunyuan 83.24%、Gen-3 82.32%、CogVideoX1.5-5B 82.17%、Kling 81.85%;Wan 1.3B 83.96%

设置:Wan 14B(2025-02-24 checkpoint),公开 VBench 榜(Table 4, p23)

指标:Wan-Bench 加权总分

数值:0.724(14B);0.689(1.3B)

基线:Sora 0.700、CN-TopA 0.693、CN-TopB 0.690、Hunyuan 0.673、Mochi 0.639

设置:每模型 1,035 样本、Wan-Bench prompts;14 维自动评分 + 5,000+ 对人工偏好加权(Table 2, p21;§4.6-4.7.1, p21-22)

指标:人工评测 T2V 胜率

数值:overall ranking:vs Runway 67.6%、vs CN-TopC 48.9%、vs CN-TopA 44.0%、vs CN-TopB 44.0%;matching:vs Runway 69.1%;visual quality:vs Runway 48.1%

基线:逐对对比中 Wan 14B 胜出比例;总轮数 overall 5,560 / visual 5,710 / motion 5,785 / matching 5,578

设置:700+ 任务、20+ 标注者、4 维度(Table 3, p23)

指标:VAE 重建 PSNR 与速度

数值:PSNR≈38(对比模型中最高);重建速度 2.5× HunyuanVideo

基线:HunyuanVideo(215M)PSNR≈36.5;Mochi、CogVideoX、CVVAE、SVD、StepVideo、Open Sora Plan 均更低;同压缩率 4×8×8 + latent 16 对齐

设置:200 视频、25 帧、720×720(Fig 7, p12;§4.1.4, p12)

指标:推理加速

数值:diffusion cache 1.62×;8-bit FlashAttention 1.27×、H20 上 95% MFU;FP8 GEMM 1.13×(DiT 模块)

基线:无缓存 BF16 基线;FA3 原生 FP8 在视频上质量明显退化(改用混合 int8/FP8 + FP32 跨块累加)

设置:Wan 14B T2V(§4.4.2, p18;§4.4.3, p18-19)

指标:实时生成 FPS

数值:8–16 FPS(LCM+Streamer);单 4090 int8+TensorRT 8 FPS;演示 20 FPS

基线:原始 50 步扩散需数分钟生成数秒视频;LCM 蒸馏 10–20×

设置:8 A100 生成 15 分钟视频(Fig 30, p42);单 RTX 4090(Fig 31, p42;§5.6.3, p44)

指标:文本编码器 FID(T2I)

数值:umT5(5.3B)43.01

基线:Qwen-VL-7B 末层 43.72、倒数第二层 42.91(略优);Qwen2.5-7B / GLM-4-9B 训练 loss 更高

设置:T2I 任务、global size 1536(Table 6, p25;Fig 17, p25)

指标:VAE vs VAE-D(FID↓)

数值:15k 步 40.55 vs 41.16;10k 步 42.60 vs 44.21

基线:VAE-D(重建 loss 换扩散 loss)全面更差

设置:T2I 任务 150k 步(Table 5, p25)

指标:caption 模型(F1)

数值:10 维整体与 Gemini 1.5 Pro 相当;slow-fast 编码使 VideoMME 无字幕 67.6→69.1

基线:Gemini 1.5 Pro 密集 caption

设置:CAPability 协议、每维 1,000 视频(Fig 4, p9;§3.3.3, p9)

指标:视频个性化 ArcFace 相似度

数值:0.5526

基线:CN-TopA 0.5655(略高)、CN-TopB 0.5197、CN-TopC 0.4998

设置:Table 8, p37

指标:规模/成本事实

数值:DiT 占训练计算 >85%;1M token 序列时 attention 占端到端训练时间 ≤95%;激活内存 >8TB(micro-batch 1);14B 未优化单卡推理约 30 分钟/视频;1.3B 仅需 8.19GB VRAM

基线:标准 LLM 激活系数 γ≈34 vs DiT γ>60

设置:§4.3.1, p15;§6, p47;Abstract, p1

代价:训练/推理成本仍是主要代价:14B 未优化单卡约 30 分钟/视频(§6, p47);TensorRT 量化以 flickering/时序不连贯为代价(§5.6.3, p44);评测依赖自建 Wan-Bench 与内部数据,跨机构可比性有限(§4.6, p20-21);训练数据内部版权+公开混合、算力规模不披露,『训练复现』成本未知。

可迁移性:未系统验证:报告为单机构系统报告,8 个下游任务全部基于同一基础模型族;机制级结论(因果性、双向注意力、窗口依赖假设)未迁移到其他架构/数据规模验证;正向条件是代码与全部权重开源(github.com/Wan-Video/Wan2.1),第三方可复现评测与微调(Abstract, p1;§6, p48)。

闭环自评

环节强度
现象→机制中偏弱。现象记录丰富且系统(flicker、长视频限制、chunk 边界断裂、双向 vs 单向注意力差异、跨步注意力相似性、合成图污染阈值),但多数停留在定性描述+设计动机,只有 caption slow-fast(VideoMME 67.6→69.1)与注意力缓存(1.62×)等少数现象有直接量化;『因果性关键』『窗口依赖』等机制断言基本未测。
机制→干预弱(最弱一环)。报告从不宣称机制,干预设计来自工程经验与观察复用(HunyuanVideo 的双向注意力观察、DiT 系主流范式、流匹配框架),没有任何『从机制假设推出干预』的可证伪链条;因果性带来时序一致、窗口内依赖假设、跨步注意力冗余三条都没有对照实验隔离——机制→干预在整份报告里是缺席的,而非薄弱。
干预→收益中。端到端收益强且有外部基线(VBench 86.22% vs Sora 84.28%、Wan-Bench 0.724 vs Sora 0.700、人工胜率),但多个数字来自自建评测/自报榜单;消融只到模块级训练 loss(AdaLN/编码器/VAE-D),无逐干预归因、无 seed 方差、无显著性检验。
最弱一环mechanism_to_intervention:Wan 是系统级技术报告,闭环中『机制假设』与『机制→干预』两环近乎缺席——干预直接由工程观察驱动,缺少任何可证伪的机制链条,如实标注为整份报告的最弱一环。

问题

要解决什么

为什么 prior work 不够

关键结果

指标最强 baselinesetup
VBench 总分86.22%(visual 86.67 / semantic 84.44)Sora 84.28%、MiniMax 83.41%、Hunyuan 83.24%、Gen-3 82.32%、CogVideoX1.5-5B 82.17%、Kling 81.85%;Wan 1.3B 83.96% 亦超 Hunyuan/Kling/CogVideoXWan 14B (2025-02-24);Table 4, p23
Wan-Bench 加权总分0.724(14B)Sora 0.700、CN-TopA 0.693、CN-TopB 0.690、Wan 1.3B 0.689、Hunyuan 0.673、Mochi 0.6391,035 样本/模型、Wan-Bench prompts、5,000+ 对人工偏好加权;Table 2, p21
人工评测 T2V 胜率(overall ranking)vs Runway 67.6%、CN-TopC 48.9%、CN-TopA 44.0%、CN-TopB 44.0%matching 维度 vs Runway 69.1%;visual quality vs Runway 48.1%700+ 任务、20+ 标注者、4 维度;Table 3, p23
VAE 重建 PSNR 与速度PSNR≈38(全场最高);速度 2.5× HunyuanVideoHunyuanVideo 215M PSNR≈36.5;同压缩率 4×8×8+latent 16 对齐;Mochi/CogVideoX/CVVAE/SVD/StepVideo/Open Sora Plan 均更低200 视频、25 帧、720×720;Fig 7, p12;§4.1.4, p12
推理加速diffusion cache 1.62×;8-bit FlashAttention 1.27×;FP8 GEMM 1.13×(DiT)无缓存 BF16 基线;FA3 原生 FP8 质量明显退化Wan 14B T2V;§4.4.2, p18;§4.4.3, p18-19
实时生成8–16 FPS(LCM+Streamer,10–20× 加速);单 4090 int8+TensorRT 8 FPS;演示 20 FPS原始 50 步扩散数分钟/数秒视频8 A100 生成 15 分钟视频(Fig 30, p42);RTX 4090(Fig 31, p42;§5.6.3, p44)
文本编码器 FIDumT5 43.01Qwen-VL-7B 末层 43.72、倒数第二层 42.91(仅此处略优);Qwen2.5-7B/GLM-4-9B 训练 loss 更高T2I、1536 global size;Table 6 + Fig 17, p25

Insights

vs 同类工作

局限

可复现性

代码与全部模型权重开源:https://github.com/Wan-Video/Wan2.1(Abstract, p1;§6, p48)。VAE/DiT 架构、训练超参(bf16、AdamW wd=1e-3、lr=1e-4、flow matching 方程 Eq.1-3、logit-normal 采样)、课程阶段(256px T2I→192/480/720px)均有文字级描述(§4.1-4.2, p10-15),可在开源权重上复现评测与下游微调;但训练数据(内部版权+公开混合、数十亿图文、O(1) 万亿 token)与算力不披露,Wan-Bench 的具体 prompt 集与打分模型未全部发布,人工评测协议无细节,『从零复现训练』不可行、『复现评测/微调』可行。注意:arXiv 显示 62 位作者('Team Wan and 61 other authors'),正文 §7 按名字母序列出;本文档基于 v2(2025-04-19),与 v1(2025-03-26)为同版式,数字以 v2 为准。

Figure 7 p.12 key

VAE 重建质量(PSNR)× 效率散点(720×720 / 25 帧)

VAE 重建质量(PSNR)× 效率散点(720×720 / 25 帧)

原文 caption:Comparison of video reconstruction performance at 720×720 resolution and 25 frames. The area of each sphere represents the size of the model parameters. (caption 由 PDF 文本清理)

VAE 设计的核心收益图:纵轴重建 PSNR、横轴效率(帧/延迟),圆点面积对应参数量,全部模型对齐 4×8×8 压缩率 + latent 16(SVD/Mochi/StepVideo 除外,见原图注)。Wan-VAE(127M 参数)落在右上角:PSNR≈38 全场最高、效率约 6 frame/latency,比 HunyuanVideo(215M)快 2.5×——证明「3D 因果 + 小模型 + feature cache」这套干预在质量与速度上同时成立,是「工程干预→可量化收益」里最干净的一处。

Figure 9 p.13 key

Wan 整体架构:Wan-VAE + DiT + umT5

Wan 整体架构:Wan-VAE + DiT + umT5

原文 caption:Architecture of the Wan. (caption 由 PDF 文本清理)

全文架构主张的目视锚点:输入视频经 Wan-VAE 编码为 latent,3D patchify 后进入 N× DiT block(全时空自注意力 + umT5 交叉注意力 + 时间步条件调制),再经 VAE 解码回像素。读图确认三件事:主干是 diffusion transformer 而非 U-ViT 分窗结构;文本条件走 umT5 交叉注意力;时间步与文本通过调制注入——后续所有干预(feature cache、diffusion cache、Streamer、量化)都挂在这条主干上。

Figure 16 p.25 supportive

四种 AdaLN 配置的训练 loss 曲线

四种 AdaLN 配置的训练 loss 曲线

原文 caption:Training loss curve with different configurations. (caption 由 PDF 文本清理)

全报告为数不多的真消融:四种 AdaLN 配置(Full-shared-1.3B / Half-shared-1.5B / Full-shared 加深 1.5B / Non-shared-1.7B)在同一 T2I 预训练设置(20 万步、global batch 1536)下的训练 loss。Full-shared-AdaLN-1.5B(35 层)收敛最低,胜过参数更多的 Non-shared-AdaLN-1.7B(30 层)——支撑「同参数下加深层数比加大 AdaLN 更有效」这一设计理由;但证据停在训练 loss 级,没有下游任务归因,也说明报告机制层验证的边界在哪。

🎧 音频版

时长 19:38 · Edge TTS

VBench 86.22% 压过 Sora 的开源视频模型,强在工程、弱在机制(对话版)

小播:今天聊一篇视频生成圈很热的技术报告——阿里的 Wan 2.1,全开源。

老播:先给结论:它在公开榜 VBench 上拿了 86.22%,压过 Sora 的 84.28%;它最强的点,是示范了一套系统级的工程范式——每个大设计都对应一个可观测现象,却没有一个被机制化检验。

小播:意思是工程很强、机制很弱?

老播:对,这是整份报告的底色。我们从头拆,先看它观察到哪些现象。

现象:注意力太贵、边界会断、采样步在偷懒

老播:第一个现象是成本。视频生成的主干是 DiT,注意力开销随序列长度平方增长。论文算了一笔账:序列到 1M token 时,注意力占训练时间的 95%。

小播:95%?那其他模块基本等于白跑。

老播:对,这个数字解释了报告里几乎所有设计——为什么要拼命压缩视频、为什么要缓存、为什么要滑动窗口。第二个现象在解码路径:长视频逐块处理时,块与块之间不维持缓存,画面就会在边界断裂。

小播:这个他们怎么修的?

老播:很轻:因果卷积的核是 3,只要缓存前一个块的末尾 2 帧,就能保证任意长度视频稳定连贯。第三个现象在采样侧:同一个 block 里,不同采样步的注意力输出高度相似,所以缓存复用,推理直接快 1.62 倍。

小播:还有个现象值得提:TensorRT 量化会带来闪烁,他们自己承认了。

老播:对,这是负例,但它比正例更接近「可检验的现象」——合成图污染不到 10% 就有害、FP8 注意力原生实现会退化、量化引入闪烁,这些才是真观测。

机制:五条设计理由,没有一条被当假说检验

小播:那机制层呢?

老播:报告给了五条设计理由,但没有一条做了对照实验。第一,时序因果性:未来帧不该影响过去帧,所以 VAE 用因果卷积加 RMSNorm。第二,双向注意力适合扩散:所以文本编码器选 umT5 而不是 decoder-only 的模型。

小播:这两条听起来都挺合理啊。

老播:合理不等于验证过。因果性的收益没有「因果对双向」的 A/B 消融;双向注意力的优势可能来自 umT5 的预训练规模,而不是注意力方向——作者没做同规模的方向对照。第三条局部窗口依赖:假设时序依赖只在一个窗口内,Streamer 才敢用滑动窗口生成无限长视频,但窗口大小本身没有消融。第四条跨步冗余和第五条深度优于 AdaLN 参数量,同样只到工程证据。

小播:那「深度优于 AdaLN」这个总该有实验吧?

老播:有,这是全报告最接近消融的一个:四种配置比训练 loss,35 层的全共享 AdaLN 模型收敛最好,胜过参数更多的 30 层模型。但证据只到训练 loss,没有下游任务归因。

干预:因果 VAE 加课程训练,把工程做满

小播:机制缺席,那工程上做了什么?

老播:先说 VAE:127M 参数的小模型,3D 因果卷积加特征缓存,200 个视频上 PSNR 约 38,全场最高,重建速度是 HunyuanVideo 的 2.5 倍。模型小一半还快两倍半,这是整份报告最干净的一处收益。

小播:训练侧呢?

老播:用 flow matching:真实视频和纯噪声之间做线性插值,模型学插值路径上的速度。配合四阶段课程——先 256 分辨率的文生图,再 192 的视频,然后 480、720 逐级上——绕开高分辨率加长时序联合训练导致的吞吐骤降。

小播:推理侧怎么做到实时的?

老播:两条路。一条是 Streamer:滑动去噪窗口,生成完最左边的 token 就出队缓存,新的噪声 token 入队,缓存 token 以噪声 0 重新注入保证衔接,配 LCM 蒸馏成 4 步,10 到 20 倍加速,8 张 A100 能 8 帧每秒实时生成 15 分钟视频。

小播:那这个 VAE 具体怎么个设计?

老播:输入视频压成四分之一时间、八分之一空间,通道扩到 16,第一帧只做空间压缩——这样图片和视频能在同一个 latent 空间里共用一套生成模型。特征缓存就是顺着这个因果结构做的:块与块之间只传递那 2 帧的边界状态。

小播:单卡呢?

老播:单张 4090,int8 加 TensorRT 量化,8 帧每秒,演示跑到 20 帧。代价就是前面说的:量化会引入闪烁。

收益与最弱一环

小播:端到端收益都带基线吗?

老播:带:VBench 86.22%,对比 Sora 84.28%、MiniMax 83.41%;自建 Wan-Bench 0.724,对比 Sora 0.700;700 多个任务的人工评测里,总体排名对 Runway 胜率 67.6%。1.3B 小模型也有 83.96%,显存只要 8.19 GB,普通显卡能跑。

小播:看起来没有短板啊?

老播:有三点要打折:VBench 数字是自报口径,Wan-Bench 是自建评测;训练数据规模不披露,端到端分数没法归因到任何单一设计;机制层最弱的一环——从「为什么这样设计」到「这样设计确实有效」之间的对照,整份报告几乎没做。

小播:所以读这份报告的正确姿势是?

老播:把「设计理由」和「已验证因果」分开记账。收益数字可信,机制叙事空缺,它是一份诚实但工程导向的报告。

收尾:一句话记住这篇

小播:最后用一句话总结?

老播:Wan 2.1 用一套「观测到现象就上工程干预」的打法,把 VBench 做到 86.22%、压过 Sora 的 84.28%,因果 VAE、缓存、滑动窗口环环相扣;但它把机制假设全部留在了「设计理由」层面,最弱一环是机制到干预的推导链。

小播:最该记住的数字是哪个?

老播:因果卷积核是 3,跨块只需缓存前 2 帧,就能无限长稳定生成——时序一致性的工程化,往往只需要一个很小的状态。带着「强工程、弱机制」这个判断去读,收益和局限都清楚了。