00 / 阅读导览
# 视频与世界模型
一个产品经理的观察笔记
VIDEO × WORLD MODELS · 2026 OBSERVATION MAP
从"生成一段看起来不错的视频",走向"搭建、控制并持续运行一个世界"。真正改变格局的,不只是画质,而是意图能否被准确表达、结果能否继续编辑、系统能否稳定交付,以及每次成功任务是否具有可持续的单位经济。
01 核心尺度 可交付任务,而非单次生成
02 三类生意 模型 API、创作工作流、互动平台
03 创作层级 世界、导演、渲染、后期
04 技术路线 扩散、流匹配、自回归、世界模型
说明|2026-07-31 :架构与训练主张优先采用论文、官方技术报告、研究博客、仓库与模型卡;闭源产品没有披露实现细节时,只写成产品声明 。融资、用户量与收入仅在来源和口径可复核时作为市场信号,不反推技术事实。
# 我的五个判断
01 竞争单位:从"惊艳一刻"到"任务完成率" 短视频的"惊艳一刻"正在商品化。差异转向任务完成率:角色能否保持、镜头能否受控、失败能否局部修复、结果能否进入真实生产流程。
02 Reference-first 是意图带宽 文本提示词不是唯一入口。人物、服装、场景、镜头、动作和声音等多参考输入,把模糊描述变成可复用的生产资产,也把产品从生成器推向工作台。
03 视频模型的三类核心生意模式 视频模型有三类核心生意:模型/API 卖推理,画布与 Agent 卖工作流,互动平台卖消费时长与网络效应。它们的成本结构、留存原因、数据闭环和护城河各不相同——不能用同一把尺子去衡量。
04 “世界模型”必须有产品门槛 仅生成连续画面还不够。至少要观察动作条件、状态持续、长时一致、可交互性或可用于规划中的一项,并说明它解决了哪类用户任务。
05 商业化看成功结果,不看生成次数 更有解释力的指标是:首轮可用率、参考满足率、有效内容率、发布率、返工率、成功导出率、付费留存,以及每个可交付任务的贡献毛利。融资可以说明资源与路线选择,但不能替代产品验证。
# 统一分析框架
# 阅读路径
01 先建立骨架 生图技术如何迁移到视频,以及主干架构怎样演化
02 理解范式分岔 扩散之外,流匹配、自回归与世界模型各自解决什么
03 看模型趋势 从骨干稳定下来到下一波分岔:原生音画、可交互世界、长时序
04 看产品与商业化 比较全球玩家、三类核心生意模式和数据闭环
# 证据分级
这篇笔记不是公司排名,也不是融资清单。它是我从技术机制 → 产品能力 → 用户价值 → 商业结果 逐层推导的观察地图。
01 / 主路线概述
# 01 · 主路线概述
# 1. 一句话总览
视频生成从早期像素级 RNN/GAN/VAE 的短片段预测,发展出离散 token 自回归、像素/潜空间扩散等路线。2024 年以后, 「3D/时空压缩自编码器 + Diffusion Transformer(DiT)/Flow Matching + 大规模图像—视频联合训练」 成为开放域高画质生成的主流工程骨架;但行业并未“最终收敛”:离散/连续自回归、AR×扩散混合、动作条件世界模型与 JEPA 式表征预测仍在并行发展。Sora 技术报告的影响主要是把“统一时空 patch + Transformer 扩散 + 规模化训练”推到行业共同参照系,而不是公开了一套可逐层复现的完整架构。
上述骨架并非视频独创:潜空间压缩、级联超分、离散 AR、U-Net→DiT、Flow Matching、「图像预训练 + 时间层」、少步蒸馏等,几乎都先在文生图侧成形再接到时间轴。上游生图模块如何被视频继承,见下文 §3 生图→视频继承 。条件化接口见 03 ;2024H2 后范式分岔见 02 。
# 2. 架构图解(Mermaid)
下列框图按一手论文/报告中的公开骨架 归纳;闭源模型(Sora/Veo/Kling 等)仅画其官方披露过的模块名,不臆造未公开层结构。
# 2.1 范式演进总图
flowchart LR
A["早期<br/>RNN / GAN / VAE<br/>2014-2018"] --> B["离散 Token<br/>AR / MaskGIT<br/>2021-2022"]
B --> C["像素/潜空间扩散<br/>U-Net + Temporal<br/>2022-2023"]
C --> D["时空压缩表示 + DiT / Flow<br/>Patch 化与规模化训练<br/>2024-"]
B -.->|"并行"| C
查看 Mermaid 源码 flowchart LR
A["早期<br/>RNN / GAN / VAE<br/>2014-2018"] --> B["离散 Token<br/>AR / MaskGIT<br/>2021-2022"]
B --> C["像素/潜空间扩散<br/>U-Net + Temporal<br/>2022-2023"]
C --> D["时空压缩表示 + DiT / Flow<br/>Patch 化与规模化训练<br/>2024-"]
B -.->|"并行"| C# 2.2 路线 A:离散 Token + 自回归 / 掩码(VideoGPT / CogVideo / Phenaki)
flowchart TB
V["视频帧序列"] --> TOK["时空分词器<br/>VQ-VAE / C-ViViT"]
TOK --> Q["离散 token 序列"]
TXT["文本条件<br/>可选"] --> PRIOR
Q --> PRIOR["序列先验模型<br/>GPT 自回归<br/>或 MaskGIT 双向掩码"]
PRIOR --> Q2["生成的 token"]
Q2 --> DEC["分词器解码器"]
DEC --> OUT["输出视频"]
查看 Mermaid 源码 flowchart TB
V["视频帧序列"] --> TOK["时空分词器<br/>VQ-VAE / C-ViViT"]
TOK --> Q["离散 token 序列"]
TXT["文本条件<br/>可选"] --> PRIOR
Q --> PRIOR["序列先验模型<br/>GPT 自回归<br/>或 MaskGIT 双向掩码"]
PRIOR --> Q2["生成的 token"]
Q2 --> DEC["分词器解码器"]
DEC --> OUT["输出视频"]代表: VideoGPT(VQ+GPT)、CogVideo(大规模 AR T2V)、Phenaki(可变长故事视频 + 掩码 Transformer)。
# 2.3 路线 B:像素级联扩散(Imagen Video 类)
flowchart LR
T["文本"] --> T5["冻结 T5 编码器"]
T5 --> B0["基座视频扩散<br/>低分辨率时空体积"]
B0 --> SU["空间超分扩散<br/>级联 ×N"]
SU --> TU["时间超分扩散<br/>插帧/提 fps"]
TU --> HD["高分辨率长视频<br/>如 1280×768 / 24fps"]
查看 Mermaid 源码 flowchart LR
T["文本"] --> T5["冻结 T5 编码器"]
T5 --> B0["基座视频扩散<br/>低分辨率时空体积"]
B0 --> SU["空间超分扩散<br/>级联 ×N"]
SU --> TU["时间超分扩散<br/>插帧/提 fps"]
TU --> HD["高分辨率长视频<br/>如 1280×768 / 24fps"]要点: 全程在像素(或近像素)空间用多级扩散 堆分辨率与帧率;算力高,但 2022 年是开放域 HD 的主路径之一。
# 2.4 路线 C:潜空间 U-Net + 时间层(MagicVideo / Video LDM / SVD)
flowchart TB
subgraph encode ["压缩"]
X["视频 / 图像"] --> VAE2D["2D VAE<br/>逐帧或轻量时空"]
VAE2D --> Z["潜空间体积 z"]
end
subgraph denoise ["去噪骨干"]
Z --> UNET["图像 U-Net 权重<br/>+ Temporal Conv / Attention"]
TXT["文本 / 图像条件"] --> UNET
Tstep["扩散时间步 t"] --> UNET
UNET --> Zhat["去噪后的 z"]
end
Zhat --> DEC["VAE 解码器"]
DEC --> Y["输出视频"]
查看 Mermaid 源码 flowchart TB
subgraph encode ["压缩"]
X["视频 / 图像"] --> VAE2D["2D VAE<br/>逐帧或轻量时空"]
VAE2D --> Z["潜空间体积 z"]
end
subgraph denoise ["去噪骨干"]
Z --> UNET["图像 U-Net 权重<br/>+ Temporal Conv / Attention"]
TXT["文本 / 图像条件"] --> UNET
Tstep["扩散时间步 t"] --> UNET
UNET --> Zhat["去噪后的 z"]
end
Zhat --> DEC["VAE 解码器"]
DEC --> Y["输出视频"]训练配方(SVD 明示三阶段):
flowchart LR
P1["阶段1<br/>文生图预训练"] --> P2["阶段2<br/>大规模视频预训练"]
P2 --> P3["阶段3<br/>高质量微调"]
查看 Mermaid 源码 flowchart LR
P1["阶段1<br/>文生图预训练"] --> P2["阶段2<br/>大规模视频预训练"]
P2 --> P3["阶段3<br/>高质量微调"]代表: MagicVideo、Align Your Latents (Video LDM)、Stable Video Diffusion、Runway Gen-1/2 一代工业默认配方。
# 2.5 路线 D:主流骨架(2024–)— 时空压缩表示 + DiT / Flow Matching
flowchart TB
subgraph cond ["条件"]
Prompt["文本 Prompt"] --> TE["文本编码器<br/>T5 / MLLM 等"]
Img["可选: 首帧 / 参考图"] --> TE
end
subgraph compress ["时空压缩"]
Vid["视频 / 图像"] --> Encoder["时空视觉编码器<br/>开源常见 3D / 因果 VAE"]
Encoder --> Latent["压缩时空 latent"]
Latent --> Patch["Spacetime patchify<br/>统一可变时长与宽高比"]
end
subgraph backbone ["生成骨干"]
Patch --> DiT["Diffusion Transformer<br/>或 Flow Matching Transformer"]
TE --> DiT
Noise["噪声 / 流匹配路径"] --> DiT
DiT --> LatentOut["干净 latent tokens"]
end
LatentOut --> Unpatch["Unpatchify"]
Unpatch --> Decoder["对应视觉解码器"]
Decoder --> Out["输出视频<br/>可选原生音频分支"]
查看 Mermaid 源码 flowchart TB
subgraph cond ["条件"]
Prompt["文本 Prompt"] --> TE["文本编码器<br/>T5 / MLLM 等"]
Img["可选: 首帧 / 参考图"] --> TE
end
subgraph compress ["时空压缩"]
Vid["视频 / 图像"] --> Encoder["时空视觉编码器<br/>开源常见 3D / 因果 VAE"]
Encoder --> Latent["压缩时空 latent"]
Latent --> Patch["Spacetime patchify<br/>统一可变时长与宽高比"]
end
subgraph backbone ["生成骨干"]
Patch --> DiT["Diffusion Transformer<br/>或 Flow Matching Transformer"]
TE --> DiT
Noise["噪声 / 流匹配路径"] --> DiT
DiT --> LatentOut["干净 latent tokens"]
end
LatentOut --> Unpatch["Unpatchify"]
Unpatch --> Decoder["对应视觉解码器"]
Decoder --> Out["输出视频<br/>可选原生音频分支"]注意力两种常见实现:
flowchart TB
Full["联合时空注意力<br/>跨帧交互直接 / 算力重<br/>具体模型需以报告为准"]
Factor["分解时空注意力 STDiT 等<br/>空间注意力 + 时间注意力<br/>开源效率路线"]
查看 Mermaid 源码 flowchart TB
Full["联合时空注意力<br/>跨帧交互直接 / 算力重<br/>具体模型需以报告为准"]
Factor["分解时空注意力 STDiT 等<br/>空间注意力 + 时间注意力<br/>开源效率路线"]代表:
闭源披露:Sora 仅明确披露 spacetime patches 与 diffusion transformer,未公开其注意力是否为朴素全时空实现;Kling 披露 3D VAE + DiT;Movie Gen 披露 30B Flow Matching Transformer;Veo 3 披露音视频 latent 的联合扩散。
开源落点:CogVideoX、Open-Sora、Mochi、HunyuanVideo、Wan。
# 2.6 模型 → 架构族 对照
flowchart TB
subgraph ar ["Token + AR / Mask"]
VideoGPT
CogVideo
Phenaki
end
subgraph unet ["Latent U-Net + Temporal"]
MagicVideo
VideoLDM["Video LDM"]
SVD["Stable Video Diffusion"]
Gen2["Runway Gen-2"]
end
subgraph dit ["时空压缩表示 + DiT / Flow"]
Sora
Veo
Kling
MovieGen["Movie Gen"]
CogVideoX
OpenSora["Open-Sora"]
Hunyuan["HunyuanVideo"]
Wan
Mochi
end
DiTpaper["DiT 图像论文 2022"] -.-> dit
查看 Mermaid 源码 flowchart TB
subgraph ar ["Token + AR / Mask"]
VideoGPT
CogVideo
Phenaki
end
subgraph unet ["Latent U-Net + Temporal"]
MagicVideo
VideoLDM["Video LDM"]
SVD["Stable Video Diffusion"]
Gen2["Runway Gen-2"]
end
subgraph dit ["时空压缩表示 + DiT / Flow"]
Sora
Veo
Kling
MovieGen["Movie Gen"]
CogVideoX
OpenSora["Open-Sora"]
Hunyuan["HunyuanVideo"]
Wan
Mochi
end
DiTpaper["DiT 图像论文 2022"] -.-> dit# 2.7 条件化任务如何接到同一底座
flowchart LR
Base["同一生成底座<br/>压缩 + DiT/Flow"]
T2V["T2V<br/>文本 → 视频"] --> Base
I2V["I2V<br/>图像(+文本) → 视频"] --> Base
V2V["V2V / Edit<br/>结构或指令编辑"] --> Base
AV["Audio-Visual<br/>原生音画"] --> Base
Base --> WM["产品叙事:<br/>World Simulator"]
查看 Mermaid 源码 flowchart LR
Base["同一生成底座<br/>压缩 + DiT/Flow"]
T2V["T2V<br/>文本 → 视频"] --> Base
I2V["I2V<br/>图像(+文本) → 视频"] --> Base
V2V["V2V / Edit<br/>结构或指令编辑"] --> Base
AV["Audio-Visual<br/>原生音画"] --> Base
Base --> WM["产品叙事:<br/>World Simulator"]各箭头的条件通路见 03 。
# 3. 生图→视频继承
本节合并原「通向视频的生图脉络」:只保留被视频继承的模块与对照。
# 3.0 一句话
文生视频不是另起炉灶:主流骨架几乎都是把文生图已验证的压缩、骨干、目标与训练配方 接到时间轴上——先压缩再生成(VAE/LDM)、级联扩分辨率(Imagen)、离散 token 自回归、U-Net→DiT、再叠加 Flow Matching / 蒸馏。
# 3.1 生图侧时间线(通向视频)
# 3.2 关键继承链
# 3.2.1 VAE / VQ-VAE / VQGAN → Latent Diffusion:为何 latent 成视频默认入口
生图侧。 VQ-VAE 用向量量化得到离散 latent,再配学习到的自回归先验,可生成图像、视频与语音,并缓解强解码器下的后验崩溃。VQGAN 在量化自编码器上叠加感知损失与 patch 判别器,提高压缩率下的感知质量,使 Transformer 先验能建模高分辨率图像构成。LDM(Latent Diffusion)把扩散从像素挪到预训练自编码器的连续潜空间 :感知压缩与语义生成解耦,显著降低训练/推理算力,并以 cross-attention 接入文本等条件——这是 Stable Diffusion 系的技术底座。
通向视频。 视频比图像多一个时间维,像素扩散的算力墙更陡;把帧或时空体积先压进 latent,再在压缩域去噪,是 MagicVideo、Video LDM、SVD 到 Sora 时代 3D VAE 的共同起点。离散支线(VideoGPT / CogVideo / Emu3)继承的是 VQ 码本 + 序列先验,而非 LDM 的连续 latent 扩散。
分水岭: 「先压缩、再生成」从生图工程默认,变成视频可扩展的几乎必要条件;后续争论是 2D 逐帧 VAE vs 3D/因果时空 VAE,而不是要不要 latent。
# 3.2.2 级联 / 像素扩散 T2I(Imagen)→ Imagen Video
生图侧。 Cascaded Diffusion Models 用低分辨率基座 + 多级超分扩散扩到高分辨率,每级模型相对简单却能堆出高维输出。Imagen 将冻结的大语言模型(T5)文本嵌入 + 级联扩散做到高保真文生图,并强调缩放文本编码器往往比缩放图像扩散本身更有效。
通向视频。 Imagen Video 明确把同一套思路接到视频:冻结 T5-XXL + 七个 视频扩散子模型(1 个基座 + 3 空间超分 + 3 时间超分),生成约 1280×768、24fps、128 帧;并写明「把图像扩散的发现迁移到视频」。
分水岭: 2022 年开放域 HD 的一条主路径是像素(或近像素)级联 ;日后主流转向 latent + 单骨干,但「空间超分 × 时间超分交错」的级联直觉仍出现在部分产品/研究管线中。
# 3.2.3 自回归 T2I(DALL·E、Parti、CogView)→ CogVideo / Emu3 式视频 AR
生图侧。 DALL·E 用 Transformer 在文本与图像 token 上做自回归,实现零样本文生图。CogView 同样走 Transformer + 离散视觉 token 的大规模文生图。Parti 系统缩放自回归编码器–解码器,展示内容丰富的文生图随规模提升。
通向视频。 CogVideo 继承 CogView2 类文生图预训练,做到约 9B 级开源文生视频 Transformer,用多帧率分层训练缓解对齐。Emu3 把图像、文本、视频统一离散化后,仅用 next-token prediction 训练单一 Transformer,并显式对比扩散主导的视觉生成路线,展示高保真视频可由因果 next-token 生成。
分水岭: AR 路线把视频当成「更长的视觉 token 序列」;与扩散并行存在,2024 后以 Emu3 / 混合 AR×扩散等形式回流(详见 02 )。
# 3.2.4 U-Net 扩散 → DiT → Sora 时代视频 DiT
生图侧。 LDM/Stable Diffusion 默认去噪骨干是带 cross-attention 的 U-Net。DiT(Peebles & Xie)在 LDM 的 VAE latent 上,用操作 latent patch 的 Transformer 替换 U-Net,并展示 Gflops(深度/宽度/token 数)与 FID 的可扩展相关性。
通向视频。 OpenAI 公开称 Sora 为在视频/图像 latent 的 spacetime patches 上操作的 diffusion transformer,联合训练可变时长、分辨率与宽高比。开源侧 CogVideoX(3D VAE + Expert DiT)、Movie Gen(大规模 Flow Matching Transformer)、Wan 等均落在「压缩 + Transformer 去噪/流匹配」族内。
分水岭: 生图证明 Transformer 骨干可缩放后,视频从「U-Net + 时间层」迁到「时空 patch + DiT/Flow」;Sora 报告是叙事与产品分水岭,DiT 论文是架构一手源头。
# 3.2.5 大型 T2I 配方复用:「加时间层」(Make-A-Video、SVD、Video LDM)
这是工业落地最清晰的一条继承链:
分水岭: 「冻结或微调空间权重 + 新插时间模块」让视频研究直接吃到开放域 T2I 红利;2024 后许多工作改为联合时空训练的 3D VAE + DiT,但三阶段数据/分辨率课表仍被广泛沿用。
# 3.2.6 Flow Matching / Rectified Flow / SD3 / Flux → 视频继承
生图侧。 Flow Matching 用条件概率路径上的向量场回归训练连续归一化流,可涵盖扩散路径,也可选用 OT 等更直的路径。Rectified Flow 显式偏好噪声与数据之间的直线 传输,利于少步 Euler 采样。SD3 论文将改进的 rectified flow 噪声采样与 MM-DiT (图像/文本双模态分离权重、双向信息流)做成可缩放文生图配方。Black Forest Labs 称 FLUX.1 为约 12B 的 multimodal + parallel diffusion transformer,训练建立在 flow matching (扩散为其特例)之上。
通向视频。 Movie Gen 公开 30B 级 Flow Matching Transformer 视频基础模型;Wan 等开源视频模型采用 DiT + Flow Matching。视频侧继承的是「速度场/直线路径目标 + Transformer 骨干」,而非另发明一套生成数学。
分水岭: 2024 生图栈从 ε-预测扩散大规模转向 rectified flow / flow matching;开源视频默认目标随之对齐。
# 3.2.7 蒸馏 / Consistency / 少步 T2I → 视频实时蒸馏(简述)
生图侧。 Progressive Distillation 逐级把扩散采样步数减半。Consistency Models 学习噪声到数据的直接映射,支持一步/少步生成,并可从预训练扩散蒸馏。Distribution Matching Distillation(DMD)等把多步扩散压成一步/少步学生。Imagen Video 已将 progressive distillation + CFG 用于视频级联的快速采样。
通向视频。 CausVid 等把双向 视频扩散教师蒸馏为因果、少步 学生,以支持流式/实时生成——在「少步」之外还多一道注意力因果化鸿沟。02 中的 Self Forcing / 因果蒸馏线,是同一少步蒸馏思想在视频时序结构上的延伸。
# 3.2.8 统一多模态图像模型模糊进视频(Emu 等)
Emu3 用统一离散 token 空间覆盖图/文/视频的生成与感知,去掉扩散与「视觉编码器 + LLM」拼接式组合架构;视频生成被表述为序列上的 next-token,并可上下文续写。这把「文生图 AR」与「文生视频 AR」收成同一缩放故事,与 DiT/Flow 主流并行。
# 3.3 生图模块 → 视频如何继承(对照表)
# 4. 时间线(里程碑表)
# 5. 技术路线演变
# 5.1 早期序列/视频生成:RNN、GAN、VAE(约 2014–2018)
问题设定 :多数工作是「给定若干帧预测未来」或生成极短、低分辨率片段,而非开放域文生视频。
自回归像素/似然模型 :Video Pixel Networks(DeepMind,2016)把视频张量的时间、空间、颜色结构编码为四维依赖链,直接估计原始像素离散联合分布,在 Moving MNIST 等基准上显著改善伪影问题。
对抗生成 :Vondrick 等(NIPS 2016)提出视频 GAN(常称 VGAN),用时空卷积与前景/背景双流生成约 1 秒级「tiny video」,并强调从无标注视频学习场景动态。
离散潜变量基础 :VQ-VAE(DeepMind,2017)用向量量化得到离散 latent,再配自回归先验,论文明确展示了图像、视频 与语音生成能力,并缓解强大解码器下的后验崩溃。
范式特征 :局部、短时、低分辨率;算力与似然/对抗训练都不易扩展到开放域长视频。
# 5.2 离散 Token + 自回归 / 掩码生成(约 2021–2022)
分水岭技术变化 :先用 VQ/分词器把视频压成离散 token,再在 token 序列上做 GPT 式或 MaskGIT 式建模——继承 NLP 缩放直觉。
VideoGPT(2021) :3D 卷积 + axial attention 的 VQ-VAE 压缩时空,再用类 GPT 的 Transformer 自回归建模离散 latent;作者将其定位为「可复现的极简 Transformer 视频生成参考」。
CogVideo(2022) :约 9.4B 参数,继承 CogView2 的文生图预训练,用多帧率分层训练缓解文视频对齐;作者称其为当时最大且(可能)首个开源大规模预训练文生视频 Transformer。
Phenaki(2022): C-ViViT 因果时间注意力做可变长视频分词;双向掩码 Transformer 将文本转为视频 token;支持 随时间变化的 prompt 序列(故事) 生成任意长度视频,并联合训练大规模图文与较小规模视频文本数据。
范式特征 :token 化解决分辨率与序列长度张力;代价是码本误差、长程误差累积,以及采样速度(严格自回归尤甚)。同期扩散路线开始抢占开放域画质叙事。
# 5.3 扩散进入视频:像素级联 → 潜空间时间对齐(2022–2023)
分水岭技术变化 :从「逐帧/逐 token 预测」转向「从噪声联合去噪整段时空体积」;并迅速从像素空间迁到 LDM 潜空间 以继承文生图权重。
Video Diffusion Models(2022) 将图像扩散 U-Net 扩展为时空因子化架构,支持图像与视频联合训练;给出大规模文本条件视频生成的早期结果,以及时空扩展采样技巧。
2022 秋「文生视频」产品级研究浪潮
Make-A-Video(Meta) :外观来自成对图文,运动来自无配对视频;伪 3D 卷积与时间注意力把 T2I 扩成 T2V,无需成对文视频数据;官方博客同步发布。
Imagen Video(Google) :冻结 T5 + 基座视频扩散 + 交错空间/时间超分级联,宣称可达约 1280×768、24 fps、128 帧量级 HD。
Phenaki (见上)代表离散路线的长视频叙事分支。
潜空间效率化
MagicVideo(2022) :在预训练 VAE 潜空间训练视频扩散,相对像素 VDM 宣称约 64× FLOPs 节省;引入帧适配器与有向时间注意力以复用 T2I U-Net 权重。
LDM(Rombach 等,2021/2022): 虽是图像工作,但为后续「图像 LDM + 时间层」提供标准压缩接口。
Align Your Latents / Video LDM(2023) :先训图像 LDM,再在潜空间引入时间维并微调;可把 Stable Diffusion 变成高分辨率文生视频,并展示个性化 T2V。
产品侧:从 V2V 编辑到直接生成 Runway Gen-1 对应论文用深度结构 + 内容嵌入做可控视频合成/编辑;官方随后以 Gen-2 去掉对结构条件的依赖,支持文本/图像/视频直接生成。CTO 回顾称:先用 Gen-1 解决时序一致性,再在 Gen-2 直接做文本引导生成。
开源底座:Stable Video Diffusion(2023) 明确三阶段:文生图预训练 → 大规模视频预训练 → 高质量微调;系统化数据筛选;权重与代码开源,主打高分辨率 I2V,并展示相机 LoRA、多视角 3D prior 等下游。
范式特征 :U-Net(+temporal)主导;「继承 T2I + 插时间层」成为工业默认配方;级联超分与潜空间压缩是两条互补的 HD 路径。
# 5.4 DiT / 时空 Patch / Transformer 缩放:Sora 时代分水岭(2023–2024)
分水岭技术变化(相对上一阶段) :
关键一手节点:
DiT(Peebles & Xie,2022) :在图像潜空间用 Transformer 替换 U-Net,展示 Gflops 与 FID 的可扩展关系——Sora 报告明确引用「diffusion transformer」。
Sora(OpenAI,2024-02) :技术报告写明——在视频与图像上联合训练文本条件扩散;对视频/图像 latent 的时空 patch 做 Transformer;最大模型可生成约一分钟高保真视频;并将路径表述为通向「物理世界通用模拟器」。报告同时声明不含模型与实现细节 。
Google Veo(2024-05) :官方定位为「迄今最强视频生成模型」,1080p、可超一分钟、强语言与视觉语义理解;经 VideoFX 向创作者预览。后续 Veo 3 强调原生音频 (环境声、对白等)。
Meta Movie Gen(2024-10) :30B Transformer + Flow Matching ;最长上下文约 73K video tokens(约 16s@16fps、1080p);并覆盖个性化、指令编辑、视频转音频等「媒体基础模型套件」。
闭源产品同期爆发 :快手 Kling 官方称采用扩散 Transformer、3D VAE 时空压缩,最长约 2 分钟、30fps、1080p;Luma Dream Machine 以公开可用的文/图生视频产品形态加入竞争(公司产品页,架构细节未以论文形式充分公开)。Runway Gen-3 Alpha 强调新基础设施上的大规模多模态训练与「通向 General World Models」。
# 5.5 开源谱系 vs 闭源前沿(2024–2025)
开源谱系(可核验权重/代码/报告)
闭源/产品前沿(一手多为博客与产品页,完整架构常不公开)
OpenAI Sora
Google DeepMind Veo / Veo 3
Runway Gen-2 / Gen-3 / Gen-4 系列
快手 Kling
Luma Dream Machine / Ray 系列
Meta Movie Gen(研究披露充分,但非全面开源权重)
分岔含义 :技术骨架高度同质(压缩 + DiT/Flow + 规模化数据);差异集中在数据配方、3D VAE、注意力效率(全时空 vs 分解)、后训练对齐、音画联合与推理基础设施——开源用报告/权重逼近,闭源用产品体验领先。
# 5.6 任务形态:T2V / I2V / V2V / 世界模型
一手文献中反复出现的条件化形态:
Text-to-Video :Make-A-Video、Imagen Video、Sora、Movie Gen、Veo、CogVideoX、HunyuanVideo、Wan 等。
Image-to-Video :SVD 明确作为核心应用;Sora/Veo/产品模型普遍支持。
Video-to-Video / 编辑 :Gen-1 结构内容引导;Movie Gen Edit 指令编辑;Kling-Omni 等多模态编辑报告。
World models / 交互式生成 :Sora 报告将缩放视频生成表述为通向「general purpose simulators of the physical world」;Runway Gen-3 官方文案称迈向 General World Models;Kling-Omni 报告将多模态生成编辑框为通向 multimodal world simulators。注意 :这些多为能力叙事与研究方向,公开一手材料通常不包含 可复现的交互式环境 API 规格。
# 6. 当前主流范式与未解问题
# 6.1 当前主流范式(2025–2026 共识骨架)
若用最少组件描述「分水岭之后」的主流系统:
时空压缩器 :3D / 因果 VAE(或高压缩自编码器),同时降空间与时间维。
生成骨干 :Diffusion Transformer 或 Flow Matching Transformer;文本经 T5/MLLM 等编码后 cross-attn / 专家 AdaLN 融合。
数据飞轮 :图像–视频联合预训练 + 高质量微调 + 稠密/重写字幕。
任务扩展 :同一底座上接 I2V、首尾帧、相机控制、音画联合、指令编辑。
工程轴 :时空注意力分解(如 STDiT)与全注意力之间的效率–质量权衡;蒸馏与并行推理。
开源侧 HunyuanVideo、Wan、CogVideoX、Open-Sora、Mochi 等均落在这一骨架内,差异在实现细节与规模。
# 6.2 未解 / 薄弱问题(由一手材料直接暴露)
可复现性鸿沟 :Sora 报告明确不写实现细节;Veo/多数产品无完整技术报告;Mochi 无 arXiv 论文——开源「复现 Sora」只能逼近公开线索。
长程物理与身份一致性 :各报告均展示进步,但公开评测仍以人工偏好与内部基准为主(如 Movie Gen 的人类对比评测),缺乏统一、抗刷榜的长期一致性基准。
音画原生联合 :Veo 3、Movie Gen Audio 等说明「无声电影时代」正在结束,但音画对齐的公开训练配方仍稀缺。
世界模型名实 :产品叙事超前于可检验的交互/控制接口;一手材料多停留在生成与编辑,而非可行动的模拟器协议。
数据与安全 :训练数据配比、版权与水印(如 SynthID)披露不均,影响科学复现与治理评估。
# 7. 关键一手资料索引
# 7.1 基础与早期
# 7.2 扩散进入视频
# 7.3 Sora 时代与前沿产品/开源
本笔记仅汇总已核验的一手声明与论文主张;未将第三方榜单或二手博客作为事实来源。
02 / 前沿范式
# 02 · 视频生成前沿范式(2024H2–2026)
# 1. 一句话总览
主流骨架仍是 「时空压缩表示(开源实现多为 3D/因果 VAE)+ DiT / Flow Matching」 。2024 下半年–2026 的前沿不再只是「更大、更长、更开源」,而是在同骨架上叠加五条可核验方向——骨架同质,分岔在表示、时序因果、多模态与交互接口:
连续/离散自回归与 AR×扩散混合重返舞台。 把视频视作更长的视觉 token 序列或与扩散并行的回流路径,2024 后以 Emu3、CausVid、自回归+扩散混合等形式重新出现。
原生音画联合扩散。 在同一 DiT/Flow 骨干中联合视频、对话、效果音与背景乐,去噪一步到位(Veo 3、LTX-2、MiniMax H3 等)。
深度压缩 tokenizer + 稀疏/滑窗注意力的效率轴。 更激进的时空压缩比、长上下文的高效注意力与缓存策略,是分钟级与原生分辨率的工程前提。
因果流式蒸馏通向实时/交互。 把双向视频扩散教师蒸馏成因果、少步、可流式解码的学生模型,跨越"少步"之外的注意力因果化鸿沟。
世界模型从产品叙事走向可行动的开源/半开源平台。 Cosmos、Genie、MineWorld 等开始具备可交互、可生成、可控制的世界状态接口,而不仅是叙事 demo。
# 2. 新范式 / 架构改进地图
# 2.1 相对主流骨架的偏移一览
# 2.2 总览图(范式分岔)
flowchart TB
Mainstream["主流骨架<br/>时空压缩表示 + DiT/Flow<br/>联合时空或分解注意力"]
Mainstream --> Eff["效率扩展<br/>深压缩 AE / SSTA / 金字塔 Flow / LTX VAE"]
Mainstream --> AV["原生音画<br/>联合 latent 扩散<br/>Veo 3 / LTX-2 / MiniMax H3*"]
Mainstream --> Hybrid["时序因果扩展<br/>Chunk-AR×扩散 / CausVid 蒸馏<br/>MAGI / SkyReels-DF"]
Mainstream --> ARTok["token 统一 / 连续 AR<br/>Emu3 / NOVA"]
Mainstream --> WM["世界模型 / 交互<br/>Cosmos / Genie / MineWorld"]
Eff --> Product["产品与开源落地<br/>Wan / Hunyuan 1.5 / Seedance / Kling-Omni / H3*"]
AV --> Product
Hybrid --> Product
查看 Mermaid 源码 flowchart TB
Mainstream["主流骨架<br/>时空压缩表示 + DiT/Flow<br/>联合时空或分解注意力"]
Mainstream --> Eff["效率扩展<br/>深压缩 AE / SSTA / 金字塔 Flow / LTX VAE"]
Mainstream --> AV["原生音画<br/>联合 latent 扩散<br/>Veo 3 / LTX-2 / MiniMax H3*"]
Mainstream --> Hybrid["时序因果扩展<br/>Chunk-AR×扩散 / CausVid 蒸馏<br/>MAGI / SkyReels-DF"]
Mainstream --> ARTok["token 统一 / 连续 AR<br/>Emu3 / NOVA"]
Mainstream --> WM["世界模型 / 交互<br/>Cosmos / Genie / MineWorld"]
Eff --> Product["产品与开源落地<br/>Wan / Hunyuan 1.5 / Seedance / Kling-Omni / H3*"]
AV --> Product
Hybrid --> Product*H3:官方微信博文披露,Tech Report / 权重开放状态需再核;产品位见 04 。
# 2.3 训练–推理时序形态对照
flowchart LR
Bi["双向 DiT<br/>整段联合去噪<br/>质量上限高 / 延迟大"]
Chunk["Chunk AR×扩散<br/>段内双向、段间因果"]
Causal["帧/块因果 + KV cache<br/>流式 / 交互"]
Discrete["离散 next-token<br/>严格 AR"]
Bi -->|"蒸馏 DMD 等"| Causal
Bi -->|"Diffusion Forcing / 噪声日程"| Chunk
查看 Mermaid 源码 flowchart LR
Bi["双向 DiT<br/>整段联合去噪<br/>质量上限高 / 延迟大"]
Chunk["Chunk AR×扩散<br/>段内双向、段间因果"]
Causal["帧/块因果 + KV cache<br/>流式 / 交互"]
Discrete["离散 next-token<br/>严格 AR"]
Bi -->|"蒸馏 DMD 等"| Causal
Bi -->|"Diffusion Forcing / 噪声日程"| Chunk# 2.4 模型架构图解(有披露者)
仅画一手论文/报告写明的模块;Genie 3、Runway Gen-4/4.5 等无足够架构披露 ,不臆造层结构。历史笔记里的「3D VAE + 双向 DiT」主流骨架见 01 §2 。
# 2.4.1 Emu3 — 离散 next-token 统一多模态
flowchart TB
I["图像 / 视频帧"] --> VQ["视觉分词器<br/>离散 VQ tokens"]
T["文本"] --> TE["文本 token"]
VQ --> SEQ["统一 token 序列<br/>图文视频交错"]
TE --> SEQ
SEQ --> GPT["自回归 Transformer<br/>仅 next-token prediction"]
GPT --> OUT["解码 → 图像 / 视频 / 文本"]
查看 Mermaid 源码 flowchart TB
I["图像 / 视频帧"] --> VQ["视觉分词器<br/>离散 VQ tokens"]
T["文本"] --> TE["文本 token"]
VQ --> SEQ["统一 token 序列<br/>图文视频交错"]
TE --> SEQ
SEQ --> GPT["自回归 Transformer<br/>仅 next-token prediction"]
GPT --> OUT["解码 → 图像 / 视频 / 文本"]相对主流: 去掉扩散骨干;感知与生成共用 GPT 目标(arXiv:2409.18869 )。
# 2.4.2 NOVA — 连续空间、帧因果 + 帧内 set-by-set
flowchart TB
Text["文本"] --> Enc["文本条件编码"]
Enc --> Temporal["时间轴:frame-by-frame<br/>因果预测下一帧 latent"]
Temporal --> Spatial["空间轴:当前帧内<br/>set-by-set 掩码预测"]
Spatial --> Cont["连续值空间<br/>无 VQ 量化"]
Cont --> DiffHead["扩散式去噪头<br/>连续向量生成"]
DiffHead --> Frame["输出帧 / 视频"]
Frame -->|"下一帧条件"| Temporal
查看 Mermaid 源码 flowchart TB
Text["文本"] --> Enc["文本条件编码"]
Enc --> Temporal["时间轴:frame-by-frame<br/>因果预测下一帧 latent"]
Temporal --> Spatial["空间轴:当前帧内<br/>set-by-set 掩码预测"]
Spatial --> Cont["连续值空间<br/>无 VQ 量化"]
Cont --> DiffHead["扩散式去噪头<br/>连续向量生成"]
DiffHead --> Frame["输出帧 / 视频"]
Frame -->|"下一帧条件"| Temporal相对主流: 保留 GPT 式时序因果与帧内双向效率,但用 非量化连续 AR + 扩散头 替代离散码本(arXiv:2412.14169 )。
# 2.4.3 MAGI-1 — Chunk 级 AR × DiT 扩散
flowchart TB
VAE["潜空间编码<br/>视频 → latent"] --> C1["Chunk 1<br/>如 24 帧 / 1s@24fps"]
C1 --> D1["DiT 去噪<br/>块内整体去噪"]
D1 -->|"未完全干净即可"| C2["Chunk 2 开始"]
C2 --> D2["DiT 去噪<br/>条件=已生成 chunks"]
D2 --> Cn["Chunk N ..."]
T5["T5 文本"] --> D1
T5 --> D2
subgraph attn ["相对标准 DiT 的改动"]
BCA["Block-Causal Attention<br/>块间因果 / 块内可并行"]
PA["Parallel Attention / GQA / QK-Norm"]
FFN["Sandwich Norm + SwiGLU FFN"]
end
attn -.-> D1
查看 Mermaid 源码 flowchart TB
VAE["潜空间编码<br/>视频 → latent"] --> C1["Chunk 1<br/>如 24 帧 / 1s@24fps"]
C1 --> D1["DiT 去噪<br/>块内整体去噪"]
D1 -->|"未完全干净即可"| C2["Chunk 2 开始"]
C2 --> D2["DiT 去噪<br/>条件=已生成 chunks"]
D2 --> Cn["Chunk N ..."]
T5["T5 文本"] --> D1
T5 --> D2
subgraph attn ["相对标准 DiT 的改动"]
BCA["Block-Causal Attention<br/>块间因果 / 块内可并行"]
PA["Parallel Attention / GQA / QK-Norm"]
FFN["Sandwich Norm + SwiGLU FFN"]
end
attn -.-> D1流水线: 最多约 4 个 chunk 重叠推理;峰值算力与总时长解耦(arXiv:2505.13211 )。
# 2.4.4 Pyramid Flow — 分辨率/时间金字塔上的统一 Flow
flowchart LR
Low["低分辨率<br/>flow matching"] --> Mid["中分辨率<br/>续 flow"]
Mid --> Hi["全分辨率<br/>末级 flow"]
Hist["历史帧"] --> TP["时间金字塔<br/>压缩历史 token"]
TP --> Mid
TP --> Hi
DiT["单一 DiT 端到端"] --- Low
DiT --- Mid
DiT --- Hi
查看 Mermaid 源码 flowchart LR
Low["低分辨率<br/>flow matching"] --> Mid["中分辨率<br/>续 flow"]
Mid --> Hi["全分辨率<br/>末级 flow"]
Hist["历史帧"] --> TP["时间金字塔<br/>压缩历史 token"]
TP --> Mid
TP --> Hi
DiT["单一 DiT 端到端"] --- Low
DiT --- Mid
DiT --- Hi相对主流: 仍是 DiT + flow,但生成轨迹沿多尺度金字塔 走,降低全程全分辨率代价(arXiv:2410.05954 )。
# 2.4.5 LTX-Video — 超高压缩 VAE + 解码器末步去噪
flowchart TB
X["像素视频"] --> VAE["时空 VAE<br/>约 32×32×8 / token<br/>总压缩 ~1:192"]
VAE --> Z["极短 latent 序列"]
Z --> DiT["全时空注意力 DiT<br/>因序列短可实时"]
Text["文本"] --> DiT
DiT --> Z2["去噪 latent"]
Z2 --> Dec["VAE 解码器<br/>承担最后去噪步"]
Dec --> Y["输出视频"]
查看 Mermaid 源码 flowchart TB
X["像素视频"] --> VAE["时空 VAE<br/>约 32×32×8 / token<br/>总压缩 ~1:192"]
VAE --> Z["极短 latent 序列"]
Z --> DiT["全时空注意力 DiT<br/>因序列短可实时"]
Text["文本"] --> DiT
DiT --> Z2["去噪 latent"]
Z2 --> Dec["VAE 解码器<br/>承担最后去噪步"]
Dec --> Y["输出视频"]相对主流: patchify/部分去噪挪进 VAE 编解码 ;用压缩换全注意力实时(arXiv:2501.00103 )。
# 2.4.6 CausVid / Self Forcing — 双向 Teacher → 因果 Student
flowchart LR
Teacher["双向视频 DiT<br/>多步去噪 teacher"] -->|"DMD 等分布匹配蒸馏"| Student["因果 few-step student<br/>KV cache 流式"]
Student --> Stream["可中途改 prompt<br/>长滚出"]
SF["Self Forcing 修正"] -.->|"训练期自 rollout<br/>对齐推理分布"| Student
查看 Mermaid 源码 flowchart LR
Teacher["双向视频 DiT<br/>多步去噪 teacher"] -->|"DMD 等分布匹配蒸馏"| Student["因果 few-step student<br/>KV cache 流式"]
Student --> Stream["可中途改 prompt<br/>长滚出"]
SF["Self Forcing 修正"] -.->|"训练期自 rollout<br/>对齐推理分布"| Student相对主流: 不换生成家族,改 训练–推理时序归纳偏置 (CausVid 、Self Forcing )。
# 2.4.7 原生音画:Veo 3(薄披露)与 LTX-2(开源)
flowchart TB
subgraph veo ["Veo 3 — 官方报告级"]
VA["视频 AE → 时空 video latent"]
AA["音频 AE → 时间 audio latent"]
VA --> Joint["联合 diffusion<br/>同一步去噪"]
AA --> Joint
Joint --> VT["Transformer 去噪网络"]
end
subgraph ltx2 ["LTX-2 — 开源论文"]
V14["视频流 ~14B"]
A5["音频流 ~5B"]
V14 <-->|"双向 AV cross-attn<br/>+ cross-modality AdaLN"| A5
CFG["modality-CFG"] --> V14
CFG --> A5
end
查看 Mermaid 源码 flowchart TB
subgraph veo ["Veo 3 — 官方报告级"]
VA["视频 AE → 时空 video latent"]
AA["音频 AE → 时间 audio latent"]
VA --> Joint["联合 diffusion<br/>同一步去噪"]
AA --> Joint
Joint --> VT["Transformer 去噪网络"]
end
subgraph ltx2 ["LTX-2 — 开源论文"]
V14["视频流 ~14B"]
A5["音频流 ~5B"]
V14 <-->|"双向 AV cross-attn<br/>+ cross-modality AdaLN"| A5
CFG["modality-CFG"] --> V14
CFG --> A5
end注意: Veo 无层宽/参数量;二手「3D U-Net」说法与官方 transformer denoiser 冲突,采信 Veo-3 PDF 。LTX-2:arXiv:2601.03233 。
# 2.4.8 Cosmos 3 — MoT:Reasoner AR × Generator 扩散
flowchart TB
In["语言 / 图像 / 视频 / 音频 / 动作"] --> Shared["共享多模态表示"]
Shared --> R["Reasoner<br/>因果 AR"]
Shared --> G["Generator<br/>双向扩散 / flow"]
R <-->|"MoT 路由 / 协作"| G
G --> Pred["下一状态 / 媒体生成"]
R --> Plan["规划 / 推理 token"]
查看 Mermaid 源码 flowchart TB
In["语言 / 图像 / 视频 / 音频 / 动作"] --> Shared["共享多模态表示"]
Shared --> R["Reasoner<br/>因果 AR"]
Shared --> G["Generator<br/>双向扩散 / flow"]
R <-->|"MoT 路由 / 协作"| G
G --> Pred["下一状态 / 媒体生成"]
R --> Plan["规划 / 推理 token"]相对主流: 把「生成 DiT」与「因果推理」拆成可协作的双塔,面向 Physical AI(Cosmos 3 PDF )。
# 2.4.9 Genie 2 — 交互世界(博客级,骨架粗描)
flowchart LR
Act["动作 a_t"] --> Dyn["因果 mask Transformer<br/>动力学 / latent 预测"]
Hist["历史 latents"] --> Dyn
Dyn --> Lat["下一 latent"]
Lat --> Diff["自回归 latent diffusion<br/>解码为帧"]
Diff --> Frame["可交互帧 o_t"]
Frame --> Hist
查看 Mermaid 源码 flowchart LR
Act["动作 a_t"] --> Dyn["因果 mask Transformer<br/>动力学 / latent 预测"]
Hist["历史 latents"] --> Dyn
Dyn --> Lat["下一 latent"]
Lat --> Diff["自回归 latent diffusion<br/>解码为帧"]
Diff --> Frame["可交互帧 o_t"]
Frame --> HistGenie 3 仅有能力声明(约 24fps / 720p),无对等架构图可画 (Genie 2 博客 )。
# 2.4.10 Seedance / Kling-Omni / Hunyuan 1.5 — 报告内可核验块
flowchart TB
subgraph seedance ["Seedance 1.0"]
SV["因果 3D VAE<br/>4×16×16, C=48<br/>DiT 侧无 patchify"] --> SM["解耦时空 MMDiT<br/>+ 窗注意力"]
SM --> SR["多镜 MM-RoPE"]
SR --> SD["级联 refiner + 多阶段蒸馏"]
end
subgraph kling ["Kling-Omni"]
MVL["MVL 多模态输入"] --> Align["DiT ↔ VLM<br/>共享嵌入对齐"]
Align --> Omni["生成 / 编辑 / 推理一体"]
end
subgraph hy15 ["HunyuanVideo 1.5"]
HV["因果 3D VAE<br/>空间16× 时间4× ch=32"] --> HD["轻量 DiT ~8.3B"]
HD --> SSTA["SSTA<br/>Selective + Sliding Tile Attn"]
SSTA --> HSR["级联超分 → 1080p"]
end
查看 Mermaid 源码 flowchart TB
subgraph seedance ["Seedance 1.0"]
SV["因果 3D VAE<br/>4×16×16, C=48<br/>DiT 侧无 patchify"] --> SM["解耦时空 MMDiT<br/>+ 窗注意力"]
SM --> SR["多镜 MM-RoPE"]
SR --> SD["级联 refiner + 多阶段蒸馏"]
end
subgraph kling ["Kling-Omni"]
MVL["MVL 多模态输入"] --> Align["DiT ↔ VLM<br/>共享嵌入对齐"]
Align --> Omni["生成 / 编辑 / 推理一体"]
end
subgraph hy15 ["HunyuanVideo 1.5"]
HV["因果 3D VAE<br/>空间16× 时间4× ch=32"] --> HD["轻量 DiT ~8.3B"]
HD --> SSTA["SSTA<br/>Selective + Sliding Tile Attn"]
SSTA --> HSR["级联超分 → 1080p"]
end权重:Hunyuan 1.5 开源;Seedance / Kling-Omni 闭源 (Seedance 、Kling-Omni 、Hunyuan 1.5 )。
# 2.4.11 架构族速查(前沿增量)
flowchart TB
subgraph discrete_ar ["离散 AR"]
Emu3
end
subgraph cont_ar ["连续 AR + 扩散头"]
NOVA
end
subgraph chunk_ar ["Chunk-AR × DiT"]
MAGI1["MAGI-1"]
end
subgraph pyramid ["金字塔 Flow"]
PyramidFlow["Pyramid Flow"]
end
subgraph deepvae ["深压缩 + DiT"]
LTX["LTX-Video / LTX-2"]
DCAE["DC-AE / DC-VideoGen"]
end
subgraph distill ["因果蒸馏"]
CausVid
SelfForcing["Self Forcing"]
end
subgraph av ["原生音画"]
Veo3["Veo 3"]
LTX2["LTX-2"]
end
subgraph wm ["世界 / 交互"]
Cosmos3["Cosmos 3 MoT"]
Genie2["Genie 2"]
MineWorld
end
subgraph eff_dit ["效率化双向 DiT"]
Seedance
Hunyuan15["HunyuanVideo 1.5"]
KlingOmni["Kling-Omni"]
end
查看 Mermaid 源码 flowchart TB
subgraph discrete_ar ["离散 AR"]
Emu3
end
subgraph cont_ar ["连续 AR + 扩散头"]
NOVA
end
subgraph chunk_ar ["Chunk-AR × DiT"]
MAGI1["MAGI-1"]
end
subgraph pyramid ["金字塔 Flow"]
PyramidFlow["Pyramid Flow"]
end
subgraph deepvae ["深压缩 + DiT"]
LTX["LTX-Video / LTX-2"]
DCAE["DC-AE / DC-VideoGen"]
end
subgraph distill ["因果蒸馏"]
CausVid
SelfForcing["Self Forcing"]
end
subgraph av ["原生音画"]
Veo3["Veo 3"]
LTX2["LTX-2"]
end
subgraph wm ["世界 / 交互"]
Cosmos3["Cosmos 3 MoT"]
Genie2["Genie 2"]
MineWorld
end
subgraph eff_dit ["效率化双向 DiT"]
Seedance
Hunyuan15["HunyuanVideo 1.5"]
KlingOmni["Kling-Omni"]
end
# 3. 分主题深挖
# 3.1 自回归回归:离散统一、连续非量化、Chunk 混合
是什么 在 DiT 主导之后,AR 以三种形态回潮:(a)离散统一多模态 ;(b)连续 latent 上的非量化 AR ;(c)chunk 级自回归扩散 (段内仍是扩散)。
相对旧范式 旧 AR(VideoGPT/CogVideo)受 VQ 误差与慢采样拖累;新工作要么去掉量化(NOVA 继承 MAR 思路),要么把「AR」提升到 chunk/帧块 粒度以保留扩散画质,要么用离散 token 换取与 LLM 同构的统一训练目标。
代表工作
怀疑点 Emu3/NOVA 的「全面超越扩散」主张多依赖选定基准与人类评测;开放域长视频与闭源 DiT 产品(Veo/Sora 级)的直接、可复现对照仍然稀缺 。MAGI「world model」用语偏产品/报告修辞,架构上仍是生成式视频模型。
# 3.2 因果流式、蒸馏与实时交互生成
是什么 把预训练双向 视频 DiT 改编/蒸馏为因果 few-step 生成器,配合 KV cache,实现流式、可中途改 prompt 的交互。
相对旧范式 旧范式:整段双向注意力 → 必须等全序列;新范式:teacher 可双向,student 强制因果 ,用分布匹配蒸馏(DMD)缓解误差累积。
代表工作
怀疑点 「实时」高度依赖分辨率、时长、步数与硬件;CausVid/Self Forcing 与 LTX 路线解决的是不同瓶颈(因果延迟 vs 压缩/步数)。第三方榜单 Elo 不是 架构证明。
# 3.3 Tokenizer / VAE:更深压缩与 chunk-causal 时间建模
是什么 在 8× 空间 + 4× 时间的「开源标配」之上,冲击 32×/64× 空间 压缩,并重新设计时间因果性。
相对旧范式 旧:中等压缩 latent + DiT 侧 patchify;新:更深 AE、chunk-causal(块内双向、块间因果)、或把 patchify 并入 VAE(LTX)。
代表工作
怀疑点 更深压缩几乎总是牺牲高频;各文用不同重建指标与下游任务,跨论文压缩比不可直接比「谁更好」 。
# 3.4 注意力效率:稀疏、滑窗、打包变长
是什么 在仍使用 Transformer 骨干的前提下,用结构化稀疏降低 (O(n^2))。
代表工作
HunyuanVideo 1.5 — SSTA(Selective and Sliding Tile Attention) :动态剪枝冗余时空 token;报告相对 FlashAttention-3,10s 720p 端到端约 1.87× ;配合 8.3B 轻量 DiT + 级联超分上 1080p(arXiv:2511.18870 )。
Seedance :解耦时空层 + 窗注意力;文本主要在空间层与视觉交互(MMDiT 风格)(arXiv:2506.09113 )。
Kling-Omni VSR :超分模块用局部窗 + 奇层 shifted window,避免感受野孤岛(arXiv:2512.16776 )。
Open-Sora 2.0 :强调高压缩 AE + 系统优化,宣称约 $200k 训出商业级 11B(arXiv:2503.09642 )——属成本/工程 叙事,非新骨干物种。
成熟度 :开源侧可复现(Hunyuan 1.5、Open-Sora 2.0);闭源侧仅报告级描述。
# 3.5 原生音画与统一多模态
是什么 音频不再是「视频后配」,而是与视频 联合 latent 扩散 或双流交叉注意力同训。
代表工作
怀疑点 / 冲突
部分二手文称 Veo 3 为「3D U-Net」——与官方报告「transformer-based denoising network」冲突 ;以 Veo-3-Tech-Report.pdf 为准。
「第一个开源原生音画」等营销语依赖发布时点,应以论文时间戳核对,不宜写进架构结论。
MiniMax H3:博文未写清是否「音/视 latent 同一步 去噪」还是联合训练管线;未给参数量/压缩比;定价与「主流 1/3」为产品声明 ;权重开放与 Tech Report 需跟进。
# 3.6 世界模型与交互式仿真(与视频生成相关的部分)
# 3.6.1 先把“生成视频”和“世界模型”分开
两者可以共用 tokenizer、Transformer、扩散或自回归骨干,但产品目标不同:视频生成模型主要估计“在文本或参考素材条件下,什么视频看起来合理”;可行动世界模型还要学习近似转移关系 p(s_{t+1}, r_t | s_t, a_t),让动作改变未来,并能把预测接到规划、策略学习或交互循环。因而,画面逼真不是世界模型的充分条件 ;动作可控也不是充分条件,还要检查长滚出稳定性、状态可恢复性、奖励/价值接口以及规划是否真的使用模型。
# 3.6.2 决策学习主线:Dyna → 潜空间模型 → 为规划保留“有用信息”
Dyna(1990) 提出的不是神经视频生成器,而是一种闭环:真实交互同时更新策略/价值与环境模型,再用模型生成的“模拟经验”继续学习。它奠定了世界模型的产品判断标准——模型必须进入决策回路,单独预测得像并不够(原论文 PDF )。
World Models(2018) 把视觉压缩、时序动力学与控制器拆成 V–M–C:VAE 将图像压到 latent,MDN-RNN 预测下一 latent 的分布,小控制器读取 latent 与 RNN 隐状态行动;控制器甚至可在模型生成的“梦境”里训练后迁回真实环境。结论不是“VAE 会做视频”,而是紧凑、带不确定性的内部状态足以支持控制(arXiv:1803.10122 )。
PlaNet(2018) 用同时含确定性与随机性成分的 RSSM 学图像动力学,并在 latent 中做在线 MPC;latent overshooting 直接约束多步预测,针对的是单步准确但滚出崩溃的问题(arXiv:1811.04551 )。
MuZero(2019) 进一步说明世界模型不必重建像素,也不必恢复所有环境规则:只要隐状态转移能预测规划需要的 reward、policy 与 value,就可以接 MCTS。它优化的是“决策充分性”,不是视觉保真度(arXiv:1911.08265 )。
DreamerV3(2023) 在 RSSM 的 imagined trajectories 中训练 actor–critic,以统一配置覆盖 150 多项任务。相对 PlaNet 的测试时规划,Dreamer 把模型更多用于训练策略;其关键价值是稳定的跨域训练配方,而非一种新的视频渲染骨干(arXiv:2301.04104 )。
这条主线给视频模型一个重要反例: 逐像素还原可能保留大量与决策无关的信息;反过来,MuZero 式 latent 即便“不好看”,也可能更适合规划。 所以评测世界模型时必须把视觉质量、动力学正确性和任务成功率分开。
# 3.6.3 生成模型主线:从视频先验到可交互环境
# 3.6.4 长序列的“新扩散范式”其实分布在四个层面
这一组论文常被误写成同一类架构创新,实际分别改训练目标、训练分布、后训练与推理系统:
训练目标——Diffusion Forcing。 每个序列 token 可有独立噪声等级,在因果结构中统一 next-token 与整段扩散;它可从短训练窗口滚出更长连续序列,并允许对未来轨迹做引导。它改变的是序列扩散的学习问题,不等于某个固定 DiT 结构(arXiv:2407.01392 )。
训练分布——Self Forcing。 自回归视频扩散若训练时总看真值历史、推理时却只能看自己的输出,会产生 exposure bias。Self Forcing 在训练中用 KV cache 对自身生成结果做 rollout,并用视频级整体损失监督;few-step 扩散和截断梯度主要为控制训练成本(arXiv:2506.08009 )。
偏好后训练——KVPO。 面向已蒸馏、ODE 式自回归视频模型,它不靠额外噪声探索,而通过路由历史 KV 构造语义分支,并在 flow velocity 空间做 GRPO 式对齐。它属于在线偏好优化,不是新的预训练扩散骨干(arXiv:2605.14278 )。
推理优化——Forcing-KV。 它根据注意力头功能差异,对静态头做结构化裁剪、对动态头按片段相似度裁剪,以压缩长历史 KV cache。它解决显存和吞吐,不改变模型学习到的世界转移规律(arXiv:2605.09681 )。
因此,“第二代不再是纯 DiT、真正改的是 Diffusion 的 D”最可信的技术解释,不是简单换掉 Transformer,而是把 独立 token 噪声、因果滚出、训练—推理分布一致性、ODE 原生后训练与历史状态压缩 组合成新的序列生成范式。哪些模块属于同一家公司尚需以正式论文为准,不能仅凭公开演讲措辞反向认领论文。
# 3.6.5 统一评测:四个问题缺一不可
预测什么? 像素、连续/离散 latent、未来 embedding,还是 reward/value/policy;目标不同,FID/FVD 不能横比。
动作是否真的进入转移? 文本提示、相机轨迹与 agent action 的语义不同;必须做动作反事实测试,即固定初始状态只改变动作,看未来是否按动力学变化。
滚出是否可用? 同时报告短期画质、长程状态漂移、错误恢复、延迟/FPS 与峰值显存,不能只展示最佳短片。
是否形成决策闭环? 区分“能生成可玩画面”“能用于 MPC/MCTS”“能在想象轨迹中训练策略”三档,并最终以真实环境任务成功率校验。
结论 :Sora/Runway/Kling 的 world-simulator 表述主要是生成能力叙事;Genie、GAIA-1、GameNGen、DIAMOND、Cosmos 提供更明确的动作或仿真接口;PlaNet、MuZero、DreamerV3、V-JEPA 2-AC 则把预测接进规划或策略学习。开放域物理一致性、游戏域可玩性与机器人任务成功率是三套不同证据,不能互相替代。
# 3.7 长视频 / 多镜叙事架构技巧
「Minute+」在开放域电影级画质 上仍主要靠产品侧拼接/扩展(Veo Scene Extension 等,披露薄);开源可复现的分钟级高质量生成仍稀缺。
# 3.8 Flow Matching / 后训练 / 产品闭源层
Flow matching 仍是开源默认目标 (Wan、Seedance、多数 DiT 报告),但「post-DiT」骨干在一手文献中几乎未见被广泛采用的替代物种 ——改进多在注意力模式、压缩、因果性与训练配方。
后训练轴显著变重 :Seedance 的多维 RM + reward-max RLHF、SkyReels 运动 RL、Kling-Omni / Hunyuan 的 SFT→RL 流水线——差异常大于「又一个 DiT」。
Runway Gen-4 / Gen-4.5 :官方强调角色/场景一致性与控制(Gen-4 、Gen-4.5 );无参数量/完整骨架论文 。二手所谓「A2D 架构」等不得当作已证实一手主张 。
# 4. 值得跟踪的开放问题与「可能的下一跳」
统一目标是否收敛? next-token(Emu3)vs 连续 AR(NOVA)vs chunk-AR×扩散(MAGI)vs 双向 flow(Wan/Seedance)——开放域长视频上尚未出现不可逆赢家。
音画联合的开源配方 能否在口型/对白上稳定逼近 Veo 3?LTX-2 是当前最硬的开源锚点,但与闭源差距需独立评测。
深压缩 AE 的极限 :重建上限 vs 生成可学习性;chunk-causal 是否成为视频 VAE 默认时间归纳偏置。
真正的交互世界模型接口 :动作空间、可重置状态、长期记忆、可度量物理——Genie 博客展示能力,Cosmos 给平台,统一基准仍缺。
后训练 > 架构? RLHF/奖励模型与数据配比可能继续主导产品差距,使「DiT 变体」论文边际收益下降。
可能的下一跳(推测,非事实) :
开源侧「Veo-3-class」联合音画 + 因果实时学生模型;
Cosmos 类 omnimodal 与影游生成底座融合(动作 token 进入创作者工具);
分钟级一致依赖显式记忆/检索或 3D 状态 ,而非纯加长上下文注意力。
# 5. 一手资料索引(按主题)
# 5.1 自回归 / 混合
# 5.2 因果蒸馏 / 实时
# 5.3 Tokenizer / 压缩 / 注意力
# 5.4 原生音画 / 统一多模态产品报告
# 5.5 长视频
# 5.6 世界模型 / 交互
# 5.7 披露较薄的产品一手(能力声明 ≠ 架构证明)
# 6. 一手冲突与证据缺口(简表)
本笔记仅汇总已核验的一手声明;未将第三方榜单或未经核对的二手架构复述作为事实来源。
03 / 模型趋势
# 03 · 模型趋势
# 1. 一句话总览
骨干轴回答「生成器长什么样」;功能轴回答「用户能塞进哪些控制信号、信号从哪条通路进 DiT/U-Net」 ——同一底座上,I2V / 首尾帧 / 结构 V2V / 指令编辑 / 参考 ID / 原生音画 / 相机与轨迹等,大多是 通道拼接、掩码、交叉注意力适配器、或联合多模态 latent 的变体,而不是另起一套骨干。
# 2. 功能地图(速查)
# 3. 分功能深挖
# 3.1 首帧 I2V / 首尾帧(FLF2V)/ 关键帧条件
# 问题定义
给定一张(或两张边界)图像 + 可选文本,生成中间运动;本质是把「静态外观」钉在时间轴端点,让模型只填运动与中间态。
# 技术套路
通道拼接(工业默认) :条件帧经 VAE 得 latent,与噪声 latent(及可选 binary mask)沿 channel 拼接进 DiT/U-Net——SVD、I2VGen-XL、Wan-I2V 同族。
双流语义 + 细节 :DynamiCrafter 用 query transformer 投到文本对齐的图像上下文(cross-attn),再把全图像与噪声拼接补细节。
随机/结构化掩码扩散 :SEINE 用 random-mask;推理时首末帧可见、中间掩蔽 → 过渡;也可只露首帧做 I2V,或递归末几帧做续写。
产品 API :Veo 3.1「First and last frame」把起止图作为生成边界(含原生音频)——产品声明 ,无层结构披露。
# 代表工作
# Conditioning 路径(示意)
flowchart LR
First["首帧 / 末帧"] --> VAE["视频 VAE"]
VAE --> Zc["条件 latent z_c"]
Mask["时序 mask M<br/>1=保留 0=生成"] --> Cat
Noise["噪声 latent z_t"] --> Cat
Zc --> Cat["channel concat"]
Cat --> DiT["DiT / U-Net 去噪"]
Text["文本"] -->|"cross-attn / AdaLN"| DiT
DiT --> Out["中间帧序列"]
查看 Mermaid 源码 flowchart LR
First["首帧 / 末帧"] --> VAE["视频 VAE"]
VAE --> Zc["条件 latent z_c"]
Mask["时序 mask M<br/>1=保留 0=生成"] --> Cat
Noise["噪声 latent z_t"] --> Cat
Zc --> Cat["channel concat"]
Cat --> DiT["DiT / U-Net 去噪"]
Text["文本"] -->|"cross-attn / AdaLN"| DiT
DiT --> Out["中间帧序列"]
开源侧「两端钉死、中间大运动且身份不漂」仍难;Wan 报告亦承认仅靠帧级信息不够,SFT 阶段加图像编码器(解耦 cross-attn)补全局语义。
闭源首尾帧(Veo / Flow)无条件化实现细节 ,不可与 Wan mask 机制等同。
# 3.2 视频编辑(指令 / 结构 V2V / 遮罩 / MotionBrush)
# 问题定义
在保留源视频运动/布局的前提下改外观、局部对象或全局风格;控制信号可以是结构图、文本指令、编辑后首帧或时空 mask。
# 技术套路
# 代表工作表
# Conditioning 路径(结构 V2V vs 统一 mask)
flowchart TB
subgraph gen1 ["Gen-1 结构+内容"]
Vid["源视频"] --> Depth["单目深度 s"]
Vid --> CLIP["CLIP 内容 c"]
Depth --> EncS["结构编码 → concat z_t"]
CLIP --> XA["cross-attention"]
EncS --> UNet["视频扩散 U-Net"]
XA --> UNet
end
subgraph vace ["VACE / Wan VCU"]
T["文本 T"] --> VCU["Video Condition Unit"]
F["上下文帧 F"] --> VCU
M["mask M"] --> VCU
VCU --> Ctx["Context tokens / Adapter"]
Ctx --> DiT2["底座 DiT"]
end
查看 Mermaid 源码 flowchart TB
subgraph gen1 ["Gen-1 结构+内容"]
Vid["源视频"] --> Depth["单目深度 s"]
Vid --> CLIP["CLIP 内容 c"]
Depth --> EncS["结构编码 → concat z_t"]
CLIP --> XA["cross-attention"]
EncS --> UNet["视频扩散 U-Net"]
XA --> UNet
end
subgraph vace ["VACE / Wan VCU"]
T["文本 T"] --> VCU["Video Condition Unit"]
F["上下文帧 F"] --> VCU
M["mask M"] --> VCU
VCU --> Ctx["Context tokens / Adapter"]
Ctx --> DiT2["底座 DiT"]
end
MotionBrush:无一手方法论文 ;第三方「open-diffusion-motion-brush」是工程复现,不能当作 Runway 架构证明。
零样本注意力编辑在大运动/遮挡上易破;规模化指令编辑的训练配方多留在 Movie Gen / Kling-Omni 报告内,权重不可复现。
「产品能局部擦除/插入」≠「论文给出可复现 mask 训练课表」。
# 3.3 参考生视频(主体 / ID / 个性化 / IP-Adapter 进视频)
# 问题定义
参考一张或多张主体/人脸图,生成「同一个人/物体」的新动作视频,并尽量服从文本;难点是身份保持 vs 文本可控 vs 防 copy-paste 泄漏。
# 技术套路
视觉 token 拼接进条件 :Movie Gen PT2V 在 30B 视频模型上接参考人像,用 vision token concatenation + 身份特征(报告写明 ArcFace 过滤数据)。
频域分解注入 DiT :ConsisID 将低频全局脸型与高频身份细节分路径注入浅层 / Transformer block(tuning-free 推理)。
Subject-to-Video 跨模态对齐 :Phantom 用 text–image–video 三元组重设联合注入,覆盖单/多主体与人脸 ID。
Face adapter on T2V :ID-Animator 在 AnimateDiff 类骨干上训练 face adapter,机制显式对齐 IP-Adapter 的解耦 cross-attn。
IP-Adapter 本体 是文生图 适配器(arXiv:2308.06721 );进视频通常是「同一解耦注意力思想的视频二次训练」,不宜写成「IP-Adapter 官方视频版」。
产品参考图 :Veo 3.1「Ingredients to video」最多 3 张参考图——产品声明 。
# 代表工作
# Conditioning 路径(示意)
flowchart LR
Ref["参考图 / 脸"] --> Ext["身份/主体编码器<br/>CLIP / ArcFace / 频域拆分"]
Ext --> Inj["注入:token concat<br/>或解耦 cross-attn<br/>或分层 DiT 注入"]
Prompt["文本"] --> Inj
Inj --> Backbone["T2V / DiT 底座"]
Backbone --> Vid["保 ID 的视频"]
查看 Mermaid 源码 flowchart LR
Ref["参考图 / 脸"] --> Ext["身份/主体编码器<br/>CLIP / ArcFace / 频域拆分"]
Ext --> Inj["注入:token concat<br/>或解耦 cross-attn<br/>或分层 DiT 注入"]
Prompt["文本"] --> Inj
Inj --> Backbone["T2V / DiT 底座"]
Backbone --> Vid["保 ID 的视频"]
多主体交互、长时间身份漂移、非人脸通用物体「主体一致性」仍是开放题;Phantom / ConsisID 各有侧重。
闭源「角色一致性」产品页极多,缺可复现训练对与损失设计 时只记为产品声明。
# 3.4 音画同出(原生联合 vs 视频→音频)
# 问题定义
要的是口型/对白/环境声与画面时间对齐 的成片。需严格区分:
# 技术套路与披露
Veo 3(官方薄报告)
「diffusion process is applied jointly to temporal audio latents and spatio-temporal video latents」;各自 autoencoder;transformer-based denoising network。
无参数量、层宽、训练目标细节。
来源:Veo-3-Tech-Report.pdf ;产品:DeepMind Veo 、I/O 2025 。
注意: 二手「3D U-Net」说法与官方 PDF 冲突——采信官方。
LTX-2(开源硬锚点)
非对称双流:约 14B 视频 + 5B 音频 ;双向 AV cross-attention + cross-modality AdaLN;modality-CFG 。
来源:arXiv:2601.03233 。
Movie Gen Audio
独立 13B「video- and text-to-audio」基础模型;48 kHz;可 audio extension 拉长;与 Movie Gen Video 套件级 同步叙事,但不是 Veo 式联合 latent 同一步去噪。
来源:arXiv:2410.13720 ;Meta Blog 。
MiniMax H3 :产品声明原生双声道与多模态上下文;架构叙事见 02 ,产品位见 04 。
flowchart TB
subgraph joint ["联合音画(Veo 3 / LTX-2)"]
VA["Video AE"] --> J["同一步联合去噪"]
AA["Audio AE"] --> J
J --> OutAV["音画同步输出"]
end
subgraph v2a ["Movie Gen Audio(V2A)"]
V["已有视频 ± 文本"] --> ANet["13B 音频生成模型"]
ANet --> Aud["同步音轨"]
end
查看 Mermaid 源码 flowchart TB
subgraph joint ["联合音画(Veo 3 / LTX-2)"]
VA["Video AE"] --> J["同一步联合去噪"]
AA["Audio AE"] --> J
J --> OutAV["音画同步输出"]
end
subgraph v2a ["Movie Gen Audio(V2A)"]
V["已有视频 ± 文本"] --> ANet["13B 音频生成模型"]
ANet --> Aud["同步音轨"]
end
开源口型/对白稳定性相对闭源仍弱(评测需独立做,见 02 )。
Movie Gen 权重未放;不能把「套件能出有声片」写成「单一联合扩散模型」。
H3:能力面宽(上下文多源 + 音视频 + 编辑),但证据级别仍是官方博客 ,勿与 Veo/LTX-2 的 joint 披露等同。
# 3.5 相机控制 · 运动控制 · 多镜(点到为止)
# 运动 / pose / 轨迹
# 多镜 / 分镜
Seedance 1.0 :架构侧 多镜 MM-RoPE ;原生 multi-shot 叙事与主体一致——技术报告充分、权重闭源 。arXiv:2506.09113
与「单镜头 I2V」不同:控制信号更多在位置编码与数据课表,而非单张 mask。
flowchart LR
Cam["相机轨迹 / pose"] --> Adapter["Camera / Motion Adapter"]
Traj["物体轨迹 / MV"] --> Adapter
Adapter --> Base["冻结或微调的 T2V"]
Pose["人体 pose 序列"] --> PoseNet["Pose encoder"]
PoseNet --> Base
查看 Mermaid 源码 flowchart LR
Cam["相机轨迹 / pose"] --> Adapter["Camera / Motion Adapter"]
Traj["物体轨迹 / MV"] --> Adapter
Adapter --> Base["冻结或微调的 T2V"]
Pose["人体 pose 序列"] --> PoseNet["Pose encoder"]
PoseNet --> Base
# 3.6 长视频续写 / Scene Extension · 可交互世界
# 长视频 / 续写
分钟级开放域电影画质的可复现开源仍稀缺——与 02 §长视频一致。
# 可交互 / 动作条件世界模型
点到为止,细节见 02 §世界模型:
功能轴视角:交互 = 把动作当作另一路条件 token ,接到因果/块级生成器,而不是新的「编辑 brush」。
# 4. 一手资料索引(按功能)
# 4.1 I2V / 首尾帧 / 关键帧
# 4.2 编辑 / 结构 / 遮罩 / MotionBrush
# 4.3 参考 / ID / 个性化
# 4.4 音画
# 4.5 相机 / 运动 / 多镜 / 长视频 / 交互
# 5. 总图:条件化接口如何挂到同一底座
flowchart TB
subgraph signals ["控制信号"]
Txt["文本 / 指令"]
Img["首帧 / 末帧 / 参考图"]
Struct["深度 / sketch / pose"]
Mask["时空 mask / 笔刷区域"]
Mot["相机轨迹 / motion vector / 轨迹点"]
Aud["音频 latent(联合时)"]
Act["动作 token(世界模型)"]
end
subgraph inject ["注入接口"]
Concat["Channel concat<br/>+ 时序 mask"]
XA["Cross-attn / 解耦 IP-attn"]
Ada["AdaLN / MM-RoPE / 适配器"]
Joint["联合多模态去噪"]
end
subgraph base ["生成底座<br/>见 history / frontier"]
VAE3["3D/因果 VAE"]
DiT["DiT / Flow / 混合 AR"]
VAE3 --> DiT
end
Txt --> XA
Img --> Concat
Img --> XA
Struct --> Concat
Mask --> Concat
Mot --> Ada
Aud --> Joint
Act --> Ada
Concat --> DiT
XA --> DiT
Ada --> DiT
Joint --> DiT
查看 Mermaid 源码 flowchart TB
subgraph signals ["控制信号"]
Txt["文本 / 指令"]
Img["首帧 / 末帧 / 参考图"]
Struct["深度 / sketch / pose"]
Mask["时空 mask / 笔刷区域"]
Mot["相机轨迹 / motion vector / 轨迹点"]
Aud["音频 latent(联合时)"]
Act["动作 token(世界模型)"]
end
subgraph inject ["注入接口"]
Concat["Channel concat<br/>+ 时序 mask"]
XA["Cross-attn / 解耦 IP-attn"]
Ada["AdaLN / MM-RoPE / 适配器"]
Joint["联合多模态去噪"]
end
subgraph base ["生成底座<br/>见 history / frontier"]
VAE3["3D/因果 VAE"]
DiT["DiT / Flow / 混合 AR"]
VAE3 --> DiT
end
Txt --> XA
Img --> Concat
Img --> XA
Struct --> Concat
Mask --> Concat
Mot --> Ada
Aud --> Joint
Act --> Ada
Concat --> DiT
XA --> DiT
Ada --> DiT
Joint --> DiT读图要点: 新功能论文多数在改左边「信号」与中间「注入」,右边底座与史笔记/前沿笔记共享;评审产品时先问「有没有写出 concat / attn / 联合 latent 中的哪一种」。
# 6. 披露厚度与常见混淆(简表)
本笔记仅汇总已核验的一手声明与论文主张;未将第三方榜单、营销横评或未核对的二手架构复述作为事实来源。
04 / 全球玩家
# 04 · 视频生成:玩家地图
# 1. 总表(三列)
# 2. 按「你最关心哪一列」速查
# 3. 一句话分层(压到最小)
text
复制 定调/体验:OpenAI · DeepMind · Runway · Kling · Meta(报告) · MiniMax(Hailuo/H3)
开源底座:Wan · Hunyuan · CogVideoX · SVD · Open-Sora · LTX · Mochi(H3 权重开放待核)
下一阶段:Genie · Cosmos · GWM-1 · R1 · Odyssey · Marble / Eden
# 4. 从模型能力到产品形态:三类核心生意模式、两个数据闭环
本节是基于公开产品形态的分析框架,不是公司收入分类,也不是投资建议。技术事实仍以论文、官方文档和财报为准。
# 4.1 视频模型的三类核心生意模式
因此,“模型/API、创作工作流、互动平台”是三种不同单位经济。模型质量都是入场券,但商业可交付能力要看:在人物、风格、镜头、品牌和时长约束下,稳定完成任务的概率 ,而不是单条最佳样片。
# 4.2 数据闭环:真正有价值的是"选择与修改",但必须先有授权
公开互联网视频提供规模,自采/采购的多视角、动作、相机、深度和专业影视素材提供稀缺监督,3D 引擎与自动标注补覆盖范围。产品闭环进一步产生生成候选、用户选择、重试原因、局部修改、导出和付费等偏好信号,可用于奖励模型、评测和路由。
但“平台拥有视频或操作日志”不等于“可直接用于训练”。训练价值必须同时满足数据授权、个人信息处理、用途隔离、未成年人和人物身份保护等条件。没有这些前提,所谓数据飞轮只是潜在资源,不是已兑现壁垒。
# 4.3 Reference-first:把开放生成变成"选择性保持不变"
纯文本让模型同时猜人物、场景、动作、构图、运镜、风格、光影、节奏与声音;人物图、场景图、动作视频、运镜视频和音频参考可以固定其中一部分变量。产品价值不在“多上传几个文件”,而在明确:哪些属性必须保持,哪些属性允许改变 。
这可称为“选择性不变性(selective invariance)”:身份不变但服装可换,空间不变但镜头可动,动作不变但风格可换。它自然连接角色一致性、局部编辑、运动迁移、镜头续写和多镜头生产。Seedance 2.0 官方资料确认其可组合文本、图像、视频和音频,并分别参考构图、运动、运镜、视觉效果和声音;这支持“Reference-first 正在成为产品主线”的判断,但其效果排名仍主要来自内部评测(官方发布 )。
# 4.4 四层创作管线:世界状态 → 导演控制 → AI 渲染 → 后期交付
这不是断言未来一定由四家公司分别占据四层。更可能出现两类竞争:模型公司向上收工作流,创作工具向下接多模型;决定胜负的是谁能维护跨步骤的可编辑状态,而不只是拥有最多模型入口。
# 4.5 可核验的商业信号与暂不采用的数据
快手 2026 年一季度未经审计财报披露:可灵当季收入超过人民币 6.5 亿元,2026 年 3 月 ARR 约 5 亿美元。这是强商业验证,但属于公司披露的年化运行率 ,不是全年已确认收入(快手 IR )。
不采用附件中“四条路线累计融资 36.727 / 20.30 / 10.30 / 3.80 亿美元”的聚合结论:原文没有给出逐公司交易、日期、币种转换、债权/股权处理和去重表,无法复算;即使总数正确,按技术路线归因也受公司跨路线经营影响。
不把“融资最多”写成“技术最成熟”,也不以未披露收入推断公司商业化强弱。Marble、GWM-1、R1、Odyssey 和 Project Eden 的当前成熟度必须分别按正式产品、有限接入、研究预览来写。
# 5. 中国四厂 · 总览
四家同落在「时空 VAE + DiT/Flow」主流骨架上,但分工鲜明:快手 Kling 偏创作者产品与统一生成/编辑(权重闭源);阿里 Wan 偏 Apache 开源底座与可控/首尾帧可复现栈;腾讯混元 HunyuanVideo 偏大规模开源基础模型 + 社区许可;字节 Seed / Seedance 偏产品引擎与充分技术报告(多镜→原生音画→多模态参考),权重全程闭源。字节另有并行开源线 Bernini (Bernini Team:MLLM 语义规划 + Wan2.2 系 DiT 渲染),见下文 §7.4 公开研究版图 。
# 6. 四家对照总表
# 6.1 研究生态概览
四家旗舰之外,中国模型玩家还有大量可核验的并行研究与开源成果:
# 6.2 组织入口速查
# 7. 分节深挖
# 7.1 快手 Kling(可灵)
# 组织归属与品牌名
同系还可图(KeTu)文生图、快意(KwaiYii)LLM 在 2024 发布 PR 中并列提及,属公司大模型矩阵,非视频权重线。
# 时间线(2023–2026,一手节点)
# 技术路线(仅一手披露)
2024 发布 PR(产品声明级架构):
扩散 Transformer(DiT)
自研 3D VAE ,同步时空压缩
计算高效的 full-attention 时空建模(空间局部 + 跨帧动态一体)
来源:PR Newswire 。未披露 具体压缩比、参数量、训练目标(ε / v / Flow)、文本编码器型号。
Kling-Omni 报告(可核验块):
接口:Multimodal Visual Language(MVL)— 文本 / 参考图 / 视频上下文统一表示
三段:Prompt Enhancer(MLLM)→ Omni-Generator (扩散 Transformer 与 VLM 共享嵌入空间 )→ Multimodal Super-Resolution(条件于原始 MVL)
训练:instruction pre-train → SFT(参考生视频、图/视频编辑、语义任务)→ quality-tuning → DPO (运动动态与视觉完整性)→ 两阶段蒸馏(轨迹匹配 + 分布匹配;报告称 150→10 NFE)
基础设施:VAE/TE 与 DiT 训练流水线分离、Ulysses/TP、FP8、参考条件 cache(约 2×)等
来源:arXiv:2512.16776 。未开源权重 ;基础 Kling 系列与 Omni 的参数规模/是否同一底座 未在报告中给出可复现配置表 。
flowchart LR
MVL["MVL 输入<br/>文本/图/视频"] --> PE["Prompt Enhancer<br/>MLLM"]
PE --> Omni["Omni-Generator<br/>DiT ↔ VLM 共享嵌入"]
Omni --> VSR["Multimodal VSR"]
VSR --> Out["视频输出"]
查看 Mermaid 源码 flowchart LR
MVL["MVL 输入<br/>文本/图/视频"] --> PE["Prompt Enhancer<br/>MLLM"]
PE --> Omni["Omni-Generator<br/>DiT ↔ VLM 共享嵌入"]
Omni --> VSR["Multimodal VSR"]
VSR --> Out["视频输出"]# 能力矩阵
# 开源策略
权重/训练代码:闭源
可核验材料:发布 PR + Kling-Omni 技术报告 + 产品站
# 代表论文/报告
# 相对另外三家的差异化(一手事实)
相对 Wan/Hunyuan:无开源权重 ,外部不可复现训练;换取产品迭代与 Omni 统一接口叙事。
相对 Seedance:Omni 报告强调 生成+编辑+推理一体 与 VLM 对齐;Seedance 1.0 更早把 原生多镜 MM-RoPE 写进架构节,1.5/2.0 把 原生音画/多模态参考 写成主线。
架构白皮书密度:早期仅 PR 级;深度披露集中在 2025-12 Omni,晚于 Hunyuan/Wan/Seedance 1.0 的基础模型报告。
# 公开研究版图
入口:KlingAIResearch (本轮可见约 50+ 公开仓,视频相关命中 30+)
# 技术报告 / 统一框架
# 相机 / 多镜 / 长程 / 物理
# 效率 / 数据 / 其它
# 7.2 阿里 Wan(通义万相 / Wan-Video)
# 组织归属与品牌名
# 时间线
# 技术路线(一手)
Wan2.1 报告核心:
Wan-VAE :3D 因果 卷积;时空压缩约 4×8×8 ,latent ch=16;~127M;chunk + feature cache 支持任意长编解码
骨干:主流 DiT ;文本 cross-attention (umT5 等双语编码器消融见报告)
目标:Flow Matching / Rectified Flow 速度场;图–视频联合多阶段预训练 + 后训练
规模:公开 1.3B 与 14B ;1.3B 报告约 8.19 GB VRAM
下游:报告称覆盖至约 八类 任务(含 I2V、指令编辑、个性化等);宣称首个可在视频内生成中英文字 的模型
来源:arXiv:2503.20314 。
Wan2.2(仓库 + 官方 PR):
MoE :高噪声专家(布局)/ 低噪声专家(细节);总参约 27B ,每步激活 14B
TI2V-5B:高压缩 VAE 4×16×16 (信息压缩率称 64),消费级卡 720p
训练数据相对 2.1:图像 +65.6%、视频 +83.2%(PR)
来源:阿里云 PR ;Wan2.2 README 。
VACE: Video Condition Unit(文本+帧+mask)+ Context Adapter,统一 R2V / V2V / 掩码编辑;以 Wan 为后端之一开源权重。
来源:arXiv:2503.07598 。
flowchart LR
Pix["像素视频/图"] --> VAE["Wan-VAE<br/>因果 3D 4×8×8"]
VAE --> DiT["DiT + Flow Matching"]
Txt["umT5 等文本"] --> DiT
DiT --> Dec["VAE Decoder"]
Cond["I2V/FLF mask<br/>或 VACE VCU"] -.-> DiT
查看 Mermaid 源码 flowchart LR
Pix["像素视频/图"] --> VAE["Wan-VAE<br/>因果 3D 4×8×8"]
VAE --> DiT["DiT + Flow Matching"]
Txt["umT5 等文本"] --> DiT
DiT --> Dec["VAE Decoder"]
Cond["I2V/FLF mask<br/>或 VACE VCU"] -.-> DiT# 能力矩阵
# 开源策略
Apache License 2.0 (Wan2.1/2.2 README / LICENSE)
代表性权重:T2V-1.3B、T2V-14B、I2V-14B、FLF2V-14B、VACE-1.3B/14B;2.2:T2V-A14B、I2V-A14B、TI2V-5B、S2V-14B、Animate-14B
分发:GitHub、Hugging Face、ModelScope
# 代表论文/报告
# 相对另外三家的差异化(一手事实)
开源许可最宽松(Apache-2.0) ,且 FLF2V/VACE/S2V/Animate 可下载复现 ——四家里生态二次开发锚点最强。
相对 Hunyuan:许可无 EU/UK/KR 地域排除条款(Hunyuan Community License 有);Wan2.2 走 MoE 双专家 而非 SSTA 稀疏注意力。
相对 Kling/Seed:开源底座 vs 闭源产品 ;最新产品代际(2.5+)与开源线可能分叉,竞品报告中的「Wan 2.6」不可当作 GitHub 权重。
# 公开研究版图
# 历史底座:VGen 生态(ali-vilab)
入口:ali-vilab/VGen
# Wan 时代的扩展模型与可控生成
# 7.3 腾讯混元 HunyuanVideo
# 组织归属与品牌名
# 时间线
# 技术路线(一手)
HunyuanVideo(2024):
Causal 3D VAE :(c_t=4, c_s=8, C=16);从零训练(非图像 VAE 初始化)
Transformer:Full Attention ;Dual-stream → Single-stream (类 SD3/MMDiT 混合)
目标:Flow Matching
文本:预训练 MLLM (Decoder-Only)作编码器,强调相对 T5/CLIP 的图文对齐与指令跟随
位置:RoPE,多分辨率/多时长
训练:图像–视频联合;渐进缩放;基础设施支撑 13B 级
来源:arXiv:2412.03603 。
HunyuanVideo 1.5(2025):
8.3B Unified DiT;VAE:空间 16×、时间 4×、latent ch=32
SSTA (Selective and Sliding Tile Attention):蒸馏阶段稀疏;报告相对 FlashAttention-3,10s 720p 端到端约 1.87×
文本:Qwen2.5-VL + Glyph-ByT5 (字形/多语文字)
I2V:VAE latent 通道拼接 + SigLip 语义序列
级联 Video Super-Resolution → 1080p
后训练:CT → SFT → RLHF(I2V 含 MixGRPO 等)
来源:arXiv:2511.18870 。
flowchart LR
Pix["像素"] --> VAE["Causal 3D VAE"]
VAE --> DiT["DiT Full-Attn<br/>Dual→Single / 1.5+SSTA"]
LLM["MLLM / Qwen-VL + ByT5"] --> DiT
DiT --> Lat["低分辨率 latent"]
Lat --> VSR["VSR 网络<br/>1.5"]
VSR --> Out["至 1080p"]
查看 Mermaid 源码 flowchart LR
Pix["像素"] --> VAE["Causal 3D VAE"]
VAE --> DiT["DiT Full-Attn<br/>Dual→Single / 1.5+SSTA"]
LLM["MLLM / Qwen-VL + ByT5"] --> DiT
DiT --> Lat["低分辨率 latent"]
Lat --> VSR["VSR 网络<br/>1.5"]
VSR --> Out["至 1080p"]# 能力矩阵
# 开源策略
权重与推理/训练相关代码公开
许可:Tencent Hunyuan Community License (LICENSE )
不适用于 欧盟、英国、韩国
月活 >1 亿需另行向腾讯申请
含可接受使用与衍生模型等条款(部署前读全文)
代表性尺寸:>13B (初代);8.3B (1.5)+ VSR
# 代表论文/报告
# 相对另外三家的差异化(一手事实)
与 Wan 同为「开源底座」,但许可 更受限 ;技术点上 1.5 主打 稀疏注意力 SSTA + 轻量 8.3B ,对比 Wan2.2 的 MoE 27B/14B 激活 。
相对 Kling/Seed:可下载复现与引用;音画/统一编辑/多参考 的一手披露弱于后两者产品+报告组合。
人评叙事:初代报告声称在专家评测上优于 Gen-3、Luma 1.6 及若干国内闭源——属报告内评测,非第三方可复现协议。
# 公开研究版图
# Tencent-Hunyuan:垂直视频族(不止基础 T2V)
入口:Tencent-Hunyuan
# TencentARC:控制、编辑、世界模型
入口:TencentARC
# 7.4 字节跳动 Seed / Seedance
# 组织归属与品牌名
本笔记只展开 明确归属 Seed 视频生成 的 Seedance 线;Seedream 仅作家族索引。
# 时间线
# 技术路线(一手)
Seedance 1.0(架构披露最全):
VAE:时间因果卷积;((r_t,r_h,r_w)=(4,16,16)),(C=48);DiT 侧去掉 patchify(对齐 DC-AE 思路)
DiT:解耦时空层 + 窗注意力;空间层 MMDiT 式多模态自注意力;文本主要在空间层交互
Multishot MM-RoPE :支持镜头级 caption 与原生多镜
条件:噪声与干净/零填充帧 通道拼接 + binary mask ,统一 T2I/T2V/I2V
目标:Flow Matching + velocity;分辨率感知 shift
级联 diffusion refiner (480p→720/1080p)
后训练:细粒度 SFT + 多维 RM 的 video RLHF;多阶段蒸馏(TSCD、Score Distillation 等)称约 10× ;5s 1080p ≈ 41.4s (NVIDIA L20)
来源:arXiv:2506.09113 ;Seed 博客 。
Seedance 1.5 pro:
双分支 Diffusion Transformer + cross-modal joint;统一框架基于 MMDiT
任务:T2VA / I2VA 及单模态 T2V/I2V
同样强调 SFT + 音画向 RLHF + >10× 蒸馏加速
能力主张:多语/方言唇形同步、电影运镜、叙事连贯
来源:arXiv:2512.13507 。
Seedance 2.0:
「统一、高效、大规模」多模态音画联合 架构;输入文本/图像/音频/视频
产品规格(报告):时长 4–15s ;原生 480p/720p ;参考上限约 3 video / 9 image / 3 audio ;另有 Fast 变体
报告主体偏 评测协议(SeedVideoBench 2.0)与能力矩阵 ;参数量、VAE 压缩比、层配置等未达到 1.0 级表格披露
来源:arXiv:2604.14148 ;官方页 。
flowchart LR
subgraph s10 ["Seedance 1.0"]
VAE1["Causal VAE 4×16×16 C=48"] --> DiT1["解耦时空 MMDiT<br/>MM-RoPE 多镜"]
DiT1 --> Ref["Diffusion Refiner"]
end
subgraph s15 ["1.5 pro"]
Dual["双分支 DiT<br/>音+视 joint"] --> AV["T2VA / I2VA"]
end
subgraph s20 ["2.0"]
MM["统一多模态<br/>文图音视参考/编辑"] --> Out2["4–15s AV"]
end
s10 -.-> s15 -.-> s20
查看 Mermaid 源码 flowchart LR
subgraph s10 ["Seedance 1.0"]
VAE1["Causal VAE 4×16×16 C=48"] --> DiT1["解耦时空 MMDiT<br/>MM-RoPE 多镜"]
DiT1 --> Ref["Diffusion Refiner"]
end
subgraph s15 ["1.5 pro"]
Dual["双分支 DiT<br/>音+视 joint"] --> AV["T2VA / I2VA"]
end
subgraph s20 ["2.0"]
MM["统一多模态<br/>文图音视参考/编辑"] --> Out2["4–15s AV"]
end
s10 -.-> s15 -.-> s20# 能力矩阵
# 开源策略
权重不开源 ;充分技术报告 + 产品/API
工程与数据平台(Ray/BMF、ByteCloud/Volcengine)在 1.0 有描述,不可外部复现训练
# 代表论文/报告
# 相对另外三家的差异化(一手事实)
报告充分度 × 权重闭源 :与 Kling 同属「可引用不可复现」;1.0 在多镜与蒸馏数字上比早期 Kling PR 更可核验。
相对 Wan/Hunyuan:把 原生多镜 → 原生音画 → 多模态参考编辑 连成产品代际,而开源双雄更强在可下载底座与(Wan)可控接口。
同系 Seedream/Seed-VL 显示 Seed 是多模态生成矩阵,而非单一视频仓库。
# 公开研究版图
注意:字节视频线多团队并行 ——Seedance ≠ Seaweed ≠ Bernini ≠ ALIVE。
# 统一生成·编辑·规划
# 音画 / 动画 / 数字人
# 基础模型 / 实时 / 世界
# Bernini / ALIVE 架构对照
flowchart TB
subgraph bernini ["Bernini Team"]
P["MLLM Planner<br/>Qwen2.5-VL → ViT plan"] --> R["DiT Renderer<br/>Wan2.2 Flow"]
end
subgraph alive ["Alive Team"]
T2V["预训练 T2V MMDiT"] --> Joint["联合音画分支<br/>TA-CrossAttn + UniTemp-RoPE"]
end
subgraph seed_prod ["Seed 产品"]
SD["Seedance 1/1.5/2.0<br/>报告充分 · 权重闭源"]
end
查看 Mermaid 源码 flowchart TB
subgraph bernini ["Bernini Team"]
P["MLLM Planner<br/>Qwen2.5-VL → ViT plan"] --> R["DiT Renderer<br/>Wan2.2 Flow"]
end
subgraph alive ["Alive Team"]
T2V["预训练 T2V MMDiT"] --> Joint["联合音画分支<br/>TA-CrossAttn + UniTemp-RoPE"]
end
subgraph seed_prod ["Seed 产品"]
SD["Seedance 1/1.5/2.0<br/>报告充分 · 权重闭源"]
end
# 7.5 MiniMax(海螺 / H 系列)
# 8. 横向对比与缺口
# 8.1 可核验差异(压缩)
# 8.2 各家披露缺口 / 薄弱点
# 8.3 勿混为一谈
论文胜 ≠ 产品胜 ≠ 开源生态胜 (见上文 §1 三列读法)。
竞品互相引用的版本号(Kling 2.6/3.0、Wan 2.6、Seedance 1.5 pro 等)在对方评测表中出现,只证明产品存在于评测时点 ,不自动等于该方已发同级技术报告。
# 9. 一手资料索引(按公司)
# 9.1 快手 Kling
# 9.2 阿里 Wan
# 9.3 腾讯混元
# 9.4 字节 Seed / Seedance
# 9.5 MiniMax