跳到正文
生成模型专题 · 深度研究

一粒噪声,
怎样长成一段世界

从图片到视频,最关键的不是“模型会画画”,而是它学会了:在每一种噪声强度下,下一步该往哪里走。这篇专题从一句白话开始,一直拆到 DDPM、CFG、VAE、DiT、Flow Matching、时空 Token 与音视频联合生成。

31研究章节 16正式技术图 49一手来源 2005→2026完整谱系
蓝紫色噪声穿过潜空间方块,显影为红色纸船山水图,再延展为连续视频帧与音频波形
总览:图像模型学习从随机状态到视觉样本的方向;视频再把同一对象沿时间展开,并可联合建模声音。
01 · 一句话先懂

它不是找图,而是在学一张“方向地图”

给真实数据加上我们自己知道的噪声,模型就得到无限道自监督练习题。生成时再把这套方向倒过来用:从随机噪声出发,一小步一小步回到高概率的数据区域。

训练

我亲手把图弄脏

随机抽一张图、一个时刻 t 和一份噪声 ε。答案天然已知:刚才加进去的,就是该学会去掉的。

模型

现在该往哪修?

U-Net 或 DiT 同时看带噪 latent、时间步和 Prompt,输出噪声、干净样本、score 或 velocity。

推理

沿方向反复走

Sampler 从 seed 产生的高斯噪声开始,多次调用同一网络。常见结果会先显出低频布局再补高频细节,但具体顺序受模型、条件和采样器影响。

白话类比

想象一座被雾盖住的山。模型没有背下整张地形图,但它在每种雾度下都学会一支箭头:哪边更像真实世界。大雾时先找山系和山谷,小雾时再找石头纹理。沿箭头走很多次,一张新图就从随机起点里显出来。

Diffusion 与 Flow 完整总链路:真实图片视频经 VAE 编码和随机加噪训练 U-Net 或 DiT,推理从随机噪声经采样器反复调用模型并由 VAE 解码
训练与推理共享同一套模型权重,但训练可以随机抽时刻并行;推理必须沿时间顺序迭代。 查看原图 ↗
02 · 可拖动实验

把噪声旋钮从 100 拖到 0

这是教学机制演示,不是在线生成模型,也不是所有 checkpoint 的逐步可视化。它用固定随机噪声和分层场景表达一种常见直觉:高噪声更新更偏低频结构,低噪声更新更容易影响边缘与纹理。

纯噪声t = 100%
同一 seed · 只改变噪声时刻
什么都还看不见

状态接近标准高斯噪声;这份教学动画先显出低频方向,但真实模型的更新顺序还取决于条件、主干和采样器。

低频结构主体关系高频细节
03 · 前世今生

从 2005 年学“概率坡度”,到 2026 年联合生成声音与视频

扩散不是某一年突然冒出的产品名。Score Matching、去噪自编码器、非平衡热力学、SDE、VAE、Transformer 与数值 ODE,二十年里逐渐拼成今天的生成系统。

2005 到 2026 的 Diffusion 技术时间线:Score Matching、原始扩散、DDPM、Latent、DiT、Flow Video、统一编辑与音视频联合
真正的主线不是模型名越来越多,而是表示更省、网络更能扩、路径更直、控制更强、采样步更少。 查看原图 ↗

DDPM 把训练模板做简单

随机抽 t,一步构造 x_t,网络预测已知噪声;稳定、并行、容易规模化。

Latent 把成本压下来

先用 VAE 压图,再在潜空间扩散;高分辨率不再要求每一步都处理全像素。

DiT 与 Flow 成为扩展主线

图像变 token,文本与图像共同注意;速度场与更直轨迹让少步采样更有可能。

生成、编辑、视频和声音汇流

同一模型吃多参考图、时空 token 与音频 latent,产品开始从“出一张图”走向完整创作流程。

04 · 训练原理

一道自己出题、自己知道答案的去噪题

DDPM 最漂亮的工程点,是训练不必真的从第 0 步加到第 1000 步。高斯噪声可以合并,因此任意时刻都能从干净样本一步跳到。

前向闭式采样

xt = √ᾱt · x0 + √(1 − ᾱt) · ε

最常见的简化目标

L = E[ || ε − εθ(xt, t, c) ||² ]

这里的 c 是 Prompt、参考图或其他控制条件。更完整的变分目标还包含反向条件分布的 KL 项;现代模型也可能预测 x₀v、score 或 flow velocity。

一次 Diffusion 训练 Step:真实样本、随机时刻与噪声、一步构造带噪样本、模型预测和损失
一次训练样本只覆盖一个随机噪声时刻;海量 batch 合起来,让同一网络学会从大结构到小细节的所有阶段。 查看原图 ↗
前向加噪与反向生成两条相反路径,高噪声阶段决定布局主体,低噪声阶段修复材质边缘
前向过程由噪声日程定义,反向方向由模型学习。图中的“先全局、后细节”是常见教学直觉;Wan2.2 才明确把高/低噪声阶段交给不同专家。 查看原图 ↗
05 · 采样与 CFG

模型给方向,Sampler 决定“怎么走”

DDIM、Euler、DPM-Solver 通常不是另一套权重,而是使用同一模型输出的不同数值走法;CFG 则放大 Prompt 带来的方向差。步数和 CFG 都不是越大越好。

山 岚
结构82细节68Prompt74自然度86

机制模拟:色彩、细节和偏移只用于说明参数趋势,不代表任何真实 checkpoint 的输出。

以 checkpoint / scheduler 推荐值为准:例如 FLUX.2 klein distilled 约 4 步,Base 约 50 步;不能跨配方套同一数字。 太低可能漏条件,太高会过饱和、发硬并损失多样性。 Seed 只决定随机起点;模型、精度、scheduler 或分辨率变化都可能破坏复现。
当前组合:平衡细节和 Prompt 约束都有余量,仍保留较自然的颜色与构图。
Classifier-Free Guidance 将有条件预测与无条件预测的差值乘以 guidance scale,再加回基础方向
CFG 放大的不是“理解力”,而是 Prompt 造成的预测差;模型理解错时,高 CFG 也会把错误一起放大。 查看原图 ↗
06 · Latent 与网络骨架

VAE 把像素压成“视觉速记”,DiT 在速记里创作

VAE 决定压缩与还原质量,U-Net / DiT 决定内容、关系和运动。压得越多越省,但小字、小脸、细线和短促动作越容易在编解码时丢失。

Latent Diffusion 流程:RGB 图片经 VAE Encoder 压缩,带噪 latent 经 U-Net 或 DiT 反复预测,最终由 VAE 解码
VAE 不是完整生成器,而是有损的视觉表示与编解码器;主干模型在潜空间里学习生成方向。 查看原图 ↗
U-Net

卷积多尺度先验强,像从局部纹理一路缩到全局构图,再带着 skip connection 返回细节。

DiT

把 latent 切成 patch token,用 Transformer 一次处理整块状态;它不是逐 token 自回归。

MMDiT

文本与图像各有参数,又在 joint attention 中共同看彼此,适合更强多模态条件。

去噪网络从 U-Net 多尺度卷积,演进到 DiT 图像 Token Transformer,再到 MMDiT 文本图像双流共同注意
Diffusion / Flow 是生成路径;U-Net、DiT、MMDiT 是用来表示方向场的网络。 查看原图 ↗
07 · Flow Matching

新一代模型为什么不只说“去噪”

Flow Matching 直接学习连续概率路径的速度场;Rectified Flow 尝试把噪声到数据的运输轨迹拉直。它与 DDPM 数学目标不同,却共享 latent、DiT、条件、solver、CFG 和蒸馏生态。

DDPM Score 与 Flow Matching 路径对比:前者可沿弯曲的反向 SDE 或 ODE,后者直接学习 ODE velocity 并尝试拉直轨迹
路径更直,数值积分更有机会跨大步;但这不自动等于“一步高质量”,仍依赖模型误差、路径和蒸馏。 查看原图 ↗
DDPM / Score

每种雾度都学“哪边更上坡”

训练目标常是噪声、v 或 score;推理可以走随机反向 SDE,也可以走确定性 probability-flow ODE。

≠,但相连
Flow Matching

直接学每个时刻“河水往哪流”

网络输出 velocity,ODE solver 沿速度场积分;Rectified Flow 希望这条运输路线尽量少绕弯。

08 · 生图工具箱

Prompt 不该一个人承担所有控制

探索构图、保持原图、只改局部、固定姿态、记住角色、组合参考图,是六种不同问题。把条件分工,成功率比盲目堆 Prompt 高得多。

生图工具箱:文生图、图生图、局部重绘、ControlNet、LoRA DreamBooth 和参考图编辑围绕基础 Diffusion Flow 模型
每种控制负责一类约束:语义、原图、局部、空间、个性化或多参考。 查看原图 ↗
T2I

文生图

“我只说想要什么,其他都让模型决定。”
例子

黄色雨衣的柯基,雨夜霓虹,低机位。

适合探索;构图、身份和文字都不够确定。
I2I

图生图

“沿用这张图,但把它往另一个方向推。”
例子

把白天街景改成雨夜,保持道路和建筑。

denoise 越高,改得越多,原图也越容易漂。
MASK

局部重绘

“只准改这个区域。”
例子

只把杯子的蓝色把手改成木质。

遮罩管范围,Prompt 管新内容;边界需要羽化。
CTRL

ControlNet

“姿态、边缘或深度必须照这张施工图。”
例子

固定芭蕾舞姿态,再换成厚涂油画。

控制太强会僵,太弱会偏;先定结构再加风格。
LORA

LoRA / DreamBooth

“让模型记住这个风格或具体主体。”
例子

同一只柴犬穿宇航服出现在火星。

小数据也能定制,但要防背景绑定和过拟合。
REF

参考图编辑

“用自然语言组合一张或多张参考图。”
例子

保留人物身份,换服装,并借用另一图的材质。

语义控制更强;许多 latent 编辑工作流在多轮编解码与重采样后仍会累积漂移。
完整案例 · 商业主视觉

“一杯高级咖啡,山景”为什么不够

  1. 先定构图:16:9,杯子在右侧三分线,左侧 45% 留白。
  2. 再定材质:哑光白瓷、原木桌面、清晨薄雾、真实接触阴影。
  3. 文字单独验收:杯身只写“山岚”,若品牌字必须零错误,最后用矢量排版。
  4. 局部返工:用 Inpaint 改杯身和把手,不要整图重新抽卡。
山岚
文案安全区
45% 留白
ControlNet 架构:冻结 U-Net 编码器与可训练控制分支共享带噪 latent、时间步和文本上下文,控制图进入控制分支,12 个 skip 与 middle 的 zero-convolution 残差注入冻结解码器
ControlNet 让冻结主干与训练分支共享 x_t、时间步和文本条件;控制分支从 zero convolution 的“零影响”起步,再把 12 个 skip 与 middle 的多尺度残差注入冻结 U-Net。 查看原图 ↗
09 · 从图片到视频

视频不是多画几张图,而是多出一条时间轴

一段 5 秒、24 FPS 的视频有 120 帧。模型不仅要让每帧好看,还要让主体、动作、遮挡、镜头、物理和声音在时间上连续。

空间

这一帧好看吗?

人物结构、材质、光影和背景细节。

时间

下一帧还是它吗?

身份、纹理和配饰不能随机跳变。

因果

动作真的接得上吗?

碰撞、遮挡、重量和镜头运动要合理。

声音

听到的发生在此刻吗?

对白、口型、脚步与环境声需要同步。

视频经 3D 或 Causal VAE 压缩成时空 latent,再 Patchify 为 spacetime tokens 输入 Video DiT
时长增加时间 token,分辨率增加空间 token;全局 attention 还可能把序列成本继续平方放大。 查看原图 ↗
Prompt 改写案例 · 纸船

“一只纸船在雨里漂”缺了什么?

缺时长、运动方向、镜头运动、交互事件、身份保持和禁止切镜。视频 Prompt 要像一个小分镜,而不是一串静态名词。

6 秒连续镜头。雨后的老城区石板路,一只红色折纸船顺着水沟从左下漂向右上;摄影机低机位贴近水面缓慢跟拍;纸船绕过一片梧桐叶时轻微旋转 30 度;阴天柔光,无切镜,无慢动作。
01
02
03
04
现代生视频架构:文字镜头脚本、首帧关键帧与时空噪声进入视频生成流;LTX-2 一类音视频模型另有音频生成流,两流通过双向跨模态注意力交互,分别解码后共同进入后处理、安全与来源检查
LTX-2 一类模型让视频流与音频流双向交互,并让两种输出共同经过后处理、安全与来源检查;闭源模型是否采用同样结构,必须以公开报告为准。 查看原图 ↗
10 · 训练与推理工程

参数量只是账单的一行,时空 Token 和 NFE 才是大头

分辨率长宽都翻倍,面积先变四倍;视频再乘帧数。全局 attention 还可能平方增长。少步 solver、蒸馏、高压缩 VAE、稀疏 attention、量化和缓存是在不同层级省钱。

01来源与授权
02过滤与去重
03VLM / ASR / OCR 标注
04宽高比 / 时长 Bucket
05图像预训练
06视频课程学习
07高质量微调
08偏好 / RL / 蒸馏

代表性流水线,不是统一标准。视频数据通常更少、更脏、更难描述。Stable Video Diffusion 把“图像预训练 → 视频预训练 → 高质量视频微调”与数据筛选列为关键;Sora 报告使用 recaptioning 让训练文字更像分镜。

Diffusion 视频推理成本由时空 Token、每步模型成本、网络前向次数和端到端文本 VAE 超分共同决定
比较速度必须同时写 GPU、分辨率、帧数、steps/NFE、精度、CFG、缓存、是否含 VAE 与超分。 查看原图 ↗
Solver

走法更聪明

不重训模型,用高阶 ODE 方法跨更大步;极少步仍受轨迹误差限制。

Distill

训练一个会大步走的学生

step / consistency / guidance distillation 可把几十步压到 1~8 步。

Representation

先减少 Token

更高 VAE 压缩、更大 patch 更省,但小字与短促动作更容易损失。

System

少算、少搬、并行算

稀疏 attention、缓存、FP8/INT8、context parallel 与异步 VAE 各解决一层瓶颈。

11 · 2026 模型地图

把“公开机制、开放代码、开放权重、允许商用、只有 API”分开

有论文不等于能私有化,可下载不等于可商用。闭源模型可以讨论公开能力,但厂商没写出的架构不能靠行业传闻补齐。下面每个模型都补一个具体任务和 Prompt,帮助你把规格翻译成真实用法。

2026 生图与生视频模型地图,包括 SDXL、SD3.5、FLUX.2、Qwen-Image-2.0、Google 当前图像 API、Sora、Wan2.2、HunyuanVideo 1.5、LTX-2 与 Veo 3.1;模型之间无继承或排名箭头
图中是机制与开放边界地图,不是质量总榜;官方人评、Arena、Prompt rewrite 和安全过滤协议并不统一。 查看原图 ↗
生图Image

SD3.5

可下载权重 · 社区许可
MMDiT + Rectified Flow

Large / Turbo / Medium,适合开放工作流、LoRA 与消费级部署;它是开放权重,不是无条件开源。

更适合
本地工作流、风格微调、ControlNet / LoRA 生态
示例
复古旅行海报:红色缆车穿过雪山,左上保留标题区,丝网印刷质感,三色套印。

注意组织年营收低于 100 万美元时可按 Stability Community License 免费商用;达到 100 万美元时应联系 Stability 获取 Enterprise License,纯研究例外另见条款。复杂中文、多人小脸与品牌字仍要逐字验收。

FLUX.2

可下载权重 · 混合许可
Flow Matching Transformer

32B dev 与 4B/9B klein;生成、单参考和多参考进入同一产品线。4B / 4B Base 为 Apache-2.0;9B、9B KV、9B Base 与 dev 权重采用 FLUX Non-Commercial License。

更适合
多参考商品合成、材质迁移;4B 系列可做 Apache-2.0 部署
示例
参考图 A 的咖啡机 + 参考图 B 的胡桃木材质,放进晨光厨房,保持旋钮和品牌铭牌位置。

注意9B 与 dev 权重仅限非商业、非生产用途,生产部署需另行授权;输出能否商用仍须遵守许可条款。4B 官方约 8GB 显存,不能外推到 9B/32B。

Qwen-Image-2.0

报告 / 产品 · 无 2.0 权重
Qwen3-VL + MMDiT

面向长指令、2K、中文与文字密集内容;论文与产品已公开,但官方仓库截至 2026-07-17 未提供 2.0 checkpoint。

更适合
中文海报、图文混排、知识型视觉与精细编辑
示例
竖版科普海报,标题“潮汐从哪里来?”,三段中文说明,月球—地球—海洋关系图,蓝白教材风。

注意“擅长文字”不等于任意小字号都准确,发布前仍要逐字校验。

Nano Banana 2

闭源 API
Gemini 图像模型 · 完整机制未公开

即 Gemini 3.1 Flash Image,官方提供最高 4K 输出。Imagen 4 已弃用,并计划于 2026-08-17 关闭。

更适合
当前 Google API 图像生成与编辑、写实概念图、快速产品原型
示例
雨后植物园的微距摄影,叶面水滴折射晨光,背景有柔和温室钢架,真实 100mm macro。

注意闭源能力页不能证明它沿用 Imagen 的 Diffusion 架构;迁移时还要重新验收文字、计数、小脸与细结构。

生视频Video

Wan2.2

Video DiT + 跨时间步 MoE
Apache-2.0 权重

A14B 含两个各约 14B 的专家、每步只激活一个,合计约 27B;另有可在 24GB 显存配合 offload 运行的 5B TI2V,以及 S2V、Animate 分支。

更适合
私有化、ComfyUI / Diffusers、T2V、I2V、语音驱动和角色动画
可用输入
文字 / 首帧 / 语音 / 角色参考
示例 Prompt
6 秒连续镜头。雨夜便利店门口,黄色雨衣的柯基从左向右跑过积水;低机位平行跟拍,水花只在落脚处溅起,霓虹倒影连续,无切镜。

注意官方单卡 A14B 命令要求至少 80GB,5B 的 24GB 口径含 offload;两者的显存、速度和能力不能混成一个数字。

查看官方资料 ↗

HunyuanVideo 1.5

8.3B DiT + 3D VAE + SSTA
可下载权重 · 腾讯混元社区许可

支持 T2V / I2V、多时长与多分辨率;官方最低 14GB 显存需开启 offload,另有 8/12 步 I2V 蒸馏版。

更适合
消费级本地预览、首帧动画、LoRA 与训练研究
可用输入
文字 / 首帧
示例 Prompt
以商品首图为第一帧:磨砂银耳机静置在黑色石材上,摄影机缓慢环绕 25 度;一道窄光从左向右扫过外壳,商品比例和 Logo 不变。

注意许可不适用于欧盟、英国、韩国;发布日前一月全产品/服务合计 MAU 超 1 亿需先取得额外许可,且不得用模型或输出改进非混元 AI 模型。“14GB”还依赖 offload。

查看官方资料 ↗

LTX-2 论文 / LTX-2.3

论文:14B 视频流 + 5B 音频流
可下载权重 · 商用门槛

论文的非对称双流 Transformer 用双向 Cross-Attention 联合生成音视频;当前官方仓库已迭代到 LTX-2.3,并发布 22B checkpoint。

更适合
需要原生声音的开放音视频短片、对白场景与环境氛围
可用输入
文字分镜(同时描述画面与声音)
示例 Prompt
8 秒固定中景。深夜修车铺里,技师放下扳手说“发动机终于安静了”;远处雨声持续,金属扳手落桌发出清脆一声,嘴型与对白同步。

注意论文的 14B+5B 不能当作当前 22B checkpoint 的参数拆分;年营收达到 1000 万美元的组织还需另购商业许可。

查看官方资料 ↗

Sora 2

视频 + 音频生成 · 完整架构未公开
Legacy API · 2026-09-24 停用

系统卡披露物理、写实度、同步音频与可控性方向;消费端 Sora 已于 2026-04-26 退役,Sora API 将于 2026-09-24 停用。

更适合
已有 Sora 2 API 集成的限期迁移;新项目不再把它作为长期依赖
可用输入
文字 / API 支持的参考输入
示例 Prompt
10 秒手持纪录片镜头。滑板手冲上湿滑 U 型池,在最高点抓板旋转后落地;轮子触地声、观众短促欢呼与镜头晃动同步,人物服装全程一致。

注意必须在 2026-09-24 前完成迁移与产物归档;“物理更准确”也不是物理模拟器承诺。

查看官方资料 ↗

Veo 3.1

带声音视频 · 完整架构未公开
闭源产品

官方提供参考图、角色一致、场景延展、相机控制、首尾帧、对象增删与原生音频;Veo 3.1 Lite 模型卡于 2026-04-08 发布。

更适合
多参考商业镜头、角色连续、首尾帧转场和带声场景延展
可用输入
文字 / 1–3 张参考图 / 首尾帧 / 待延展视频
示例 Prompt
首帧是清晨空荡站台,末帧是夜晚同一机位的灯火列车;8 秒固定镜头完成昼夜过渡,站台结构不变,列车刹车声在末段由远及近。

注意官方仍把短对白自然度与同步列为持续改进项;内部人评结果不能直接替代你的业务盲测。

查看官方资料 ↗
VIDEO CASEBOOK · 06

不是“会不会生视频”,而是哪一种视频任务

同一个模型面对商品、人物、对白、转场、物理和长故事,难点完全不同。下面的 Prompt 是教学例子;候选模型表示能力形态匹配,不是质量排名。

时长+景别+主体锚点+主动作+交互事件+镜头运动+声音+禁止项
首帧 / 多参考图

商品广告:先锁商品,再让镜头动

候选:Wan2.2 I2V · HunyuanVideo 1.5 · Veo 3.1

6 秒,白色背景的银色咖啡机保持形状和铭牌不变;镜头从正面缓慢横移到右前 30 度,蒸汽在第 4 秒升起,柔光棚拍,无切镜。

验收:外形、Logo、按钮数量、反射方向和镜头轨迹。

人物首帧

人物微动:动作越少,身份越稳

候选:HunyuanVideo 1.5 · Wan2.2 I2V · Veo 3.1

5 秒近景。人物保持直视镜头,只轻轻眨眼一次并呼吸;发梢被微风向右吹动,背景树叶轻摆,摄影机固定,不转头,不露齿。

验收:五官、耳饰、发际线、手指与背景纹理是否跨帧稳定。

文字分镜 / 参考图

对白短片:画面、嘴型、语音要分开写

候选:LTX-2 · Sora 2(迁移截止 2026-09-24)· Veo 3.1

8 秒中景。雨夜出租车内,司机看着后视镜说“前面封路,我们绕一下”;雨刷每两秒扫过,车内低频引擎声持续,对白清楚,无背景音乐。

验收:台词可懂度、嘴型起止、雨刷节奏、环境声连续和人物身份。

首帧 + 尾帧

首尾帧转场:让终点也成为硬条件

候选:Veo 3.1 · 支持关键帧的工作流

从纸上铅笔画的城市天际线,平滑过渡到同构图的真实夜景;建筑轮廓逐步立体化,镜头固定,不新增高楼,最后一秒稳定停在尾帧。

验收:起点、终点、共同结构、过渡路径和末帧停留。

文字 / 首帧

运动与物理:一次只安排一个主事件

候选:Sora 2(迁移截止 2026-09-24)· Veo 3.1 · Wan2.2

7 秒低机位。玻璃弹珠从木坡滚下,只撞击一次红色积木;积木倒向右侧,弹珠减速停在桌边,摄影机不移动,其他物体保持静止。

验收:碰撞顺序、速度变化、物体永久性、接触阴影和是否凭空增物。

角色参考 + 分镜表

长故事:先拆镜头,不要要求一口气拍完

候选:Veo 场景延展 · 多模型剪辑工作流

镜头 A:侦探推门进入档案室。镜头 B:同一人物近景发现红色文件。镜头 C:走廊灯熄灭。每个镜头 5–8 秒,分别生成,再用尾帧、环境声和色彩统一衔接。

验收:角色锚点、空间方向、道具状态、色温、声音底噪与剪辑连续性。

实战建议

第一轮先做 5–8 秒、单镜头、单主事件。如果这一层都不稳定,直接要求 30 秒多镜头故事,只会把身份漂移、物理错误和声音错位叠在一起。长故事应拆成镜头表,再用参考图、尾帧、场景延展、声音底轨和剪辑统一。

证据边界 · 2026-07-17

Qwen-Image-2.0 有论文和产品,但官方仓库没有 2.0 checkpoint;Nano Banana 2 的完整网络未披露,不能因上一代 Imagen 而擅自标成 Diffusion;LTX-2 论文的 14B+5B 双流与当前 LTX-2.3 22B checkpoint 是两条版本证据;Sora 2 消费端已退役、API 将于 2026-09-24 停用,也不能继承 Sora 1 的全部架构描述;Veo 3.1 的发布方内部人评不能替代业务盲测。

12 · 评测与失败

一张漂亮样例,证明不了模型稳定

图片要拆质量、对齐、文字、身份、编辑保持与安全;视频再加运动、闪烁、物理和音画同步。真正的业务评测还要固定采样次数,不挑最好结果。

Diffusion 生图生视频评测拆成视觉质量、Prompt 对齐、编辑保持、运动闪烁、物理音画和安全记忆六个维度
自动指标用于定位问题,业务盲测用于做选择;二者不能互相替代。 查看原图 ↗
2? 3?
01

数量与属性串线

“三只杯子,红在蓝左侧”同时考计数、实例、颜色和空间绑定。模型可能概念都懂,却把绿色涂给两只杯子。

山岚 → 山□
02

文字像字但不是字

图像 loss 更在意整体感知,VAE 又压掉小字高频;准确字符、排版、透视和材质必须同时成立。

F1 ≠ F2
03

视频纹理“沸腾”

每帧单看都像真的,毛发、墙面和水纹却在相邻帧随机变化;逐帧后处理还可能把问题放大。

A → A?
04

遮挡后身份漂移

角色转身、出画再回来,需要模型保存不可见期间的身份状态;长时长和多人交叉遮挡尤其难。

因 → 果?
05

看似物理,实则穿帮

模型学到视频统计规律,不是刚体求解器;碰撞、重量、物体永久性和因果顺序仍可能失败。

v1 → v8
06

多轮编辑越改越远

许多 latent 编辑流水线会重复编解码与采样,未指定区域也可能变化;应保留原图、遮罩、参考条件和完整编辑历史。

13 · 安全与来源

生成结束,不等于责任结束

训练数据、真实人物、未成年人、误导性事件、商标与传播来源贯穿整条链。现代系统通常同时做输入检查、生成中约束、输出帧/音频检查、账号治理和 provenance。

01

输入层

Prompt、参考图与真实人物授权;不要只做关键词黑名单。

02

生成层

模型内拒绝、安全条件、未成年人和真实人物的专门限制。

03

输出层

最终图片、视频帧、音频转写和场景描述都要再次检查。

04

传播层

隐形水印、C2PA/内容凭证、服务日志与平台展示组合使用。

来源不等于事实。C2PA / 内容凭证回答“文件从哪里来、经历过什么声明”,不能证明画面描述的事件真的发生;清单还可能被剥离,软绑定或水印也会受截图、裁剪、压缩和转码影响。应组合密码学来源、平台标签、内容核验与审计链。

14 · 怎么选

先问任务,再问模型;最后算完整工作流

一个开放 base 模型可能单张分数不最高,却因 LoRA、ControlNet、许可与返工链路更适合你;一个闭源 API 也可能因稳定性与安全栈降低总成本。

Diffusion 生图生视频选型决策树,从图片视频分流,再区分纯生成、精确编辑、定制控制、T2V、I2V 关键帧与原生音视频
最终统一核对质量、失败率、端到端延迟、人工返工、许可证和安全,而不是只看一张最好样片。 查看原图 ↗
一份可执行的 PoC
  1. 收集 30~100 条真实任务,分常见、困难、风险三层。
  2. 每个模型每条固定 4 个 seed,不 cherry-pick。
  3. 统一尺寸、时长、预算、Prompt rewrite 与后处理。
  4. 业务人员盲评质量、对齐、可编辑性和失败严重度。
  5. 记录 P50/P95 延迟、成本、拒绝率和人工返工时间。
15 · FAQ

把最容易混淆的八件事一次说透

01训练也要走 1000 次吗?

不用。训练随机抽一个时刻 t,用闭式公式从干净样本一步构造带噪样本,只做一次网络前向和一次 loss。推理才需要按多个时刻顺序更新。

02模型为什么不是从图库里找图?

权重学习的是跨样本的方向函数,seed 只是随机噪声起点,不是图库编号。但高度重复或独特训练样本仍可能被记忆,因此“不是检索”不等于“绝不近似复现”。

03U-Net、DiT 和 Diffusion 是什么关系?

Diffusion / Flow 定义生成路径和训练目标;U-Net、DiT、MMDiT 是表示噪声场或速度场的神经网络骨架。换成 DiT 后依然是迭代生成。

04Flow Matching 还算 Diffusion 吗?

严格数学上它不等于传统 DDPM,而是直接学习连续概率路径的速度场。工程生态里它继承 latent、DiT、CFG、solver、蒸馏和编辑工具,因此常被归入广义 diffusion 生成系统。

05为什么视频不能逐帧生图再拼?

独立生图没有共享时序状态,同一个人的脸、衣服和背景纹理会逐帧随机变化。视频模型要联合处理时空 latent,或加入 temporal attention / convolution。

06步数越多越好吗?

不一定,必须跟 checkpoint 和 scheduler 的训练配方走。例如 FLUX.2 klein distilled 以 4 步为目标,Base 配方约 50 步;HunyuanVideo 1.5 常规版与 8/12 步 I2V 蒸馏版也不是同一条轨迹。

07图生视频为什么通常更稳?

首帧减少了外观、构图、材质与光线的不确定性,所以往往比纯文本更容易控制;它仍不保证身份、遮挡、运动或物理连续,必须逐帧验收。

08怎样用 30 秒解释 Diffusion?

训练时随机给真实图片或视频 latent 加不同强度的噪声,让网络预测噪声、干净样本或速度方向;推理时从随机噪声开始,采样器多次调用 U-Net/DiT 逐步生成。视频再把 latent 扩展为时空 token,联合保持跨帧一致性。

16 · 一手来源

研究结论可以顺着链接回到原始证据

理论与架构只采用论文、作者项目页、官方报告、官方模型卡和官方代码仓库;动态产品、许可证与退役状态截至 2026-07-17。完整 1,856 行研究底稿已先于网页落盘。

R1
Score MatchingHyvärinen · JMLR 2005
R2
Denoising 与 ScoreVincent · Neural Computation 2011
R3
原始扩散概率模型Sohl-Dickstein et al. · 2015
R4
DDPMHo, Jain & Abbeel · 2020
R5
DDIMSong, Meng & Ermon · 2020
R6
Score SDESong et al. · 2020
R7
Classifier-Free GuidanceHo & Salimans · 2022
R8
Latent DiffusionRombach et al. · CVPR 2022
R9
ImagenSaharia et al. · 2022
R10
DiTPeebles & Xie · 2022
R11
Flow MatchingLipman et al. · 2022
R12
Rectified FlowLiu et al. · 2022
R13
SD3 / MMDiTEsser et al. · 2024
R14
ControlNetZhang, Rao & Agrawala · 2023
R15
Consistency ModelsSong et al. · 2023
R16
Video Diffusion ModelsHo et al. · 2022
R17
Imagen VideoHo et al. · 2022
R18
Stable Video DiffusionBlattmann et al. · 2023
R19
LumiereBar-Tal et al. · 2024
R20
Sora 技术报告OpenAI · 2024
R21
CogVideoXYang et al. · 2024
R22
HunyuanVideoTencent Hunyuan · 2024
R23
WanWan Team · 2025
R24
Wan2.2官方仓库 · 核查于 2026-07-12
R25
HunyuanVideo 1.5官方仓库 · 核查于 2026-07-12
R26
LTX-2Lightricks · 2026
R27
FLUX.2官方仓库 / 模型卡 · 2026
R28
Qwen-Image-2.0Qwen Team · 2026
R29
Qwen-Image-2.0-RLQwen Team · 2026
R30
Sora 2 System CardOpenAI · 2025
R31
Veo 3.1Google DeepMind · 核查于 2026-07-12
R32
GenEvalGhosh et al. · 2023
R33
VBenchHuang et al. · 2023
R34
Stable Diffusion 3.5Stability AI · 官方发布
R35
Stability AI License官方许可 · 核查于 2026-07-17
R36
DreamBoothRuiz et al. · 2022
R37
LoRAHu et al. · 2021
R38
DPM-SolverLu et al. · 2022
R39
Latent Consistency ModelsLuo et al. · 2023
R40
Qwen-Image 官方仓库checkpoint 边界 · 核查于 2026-07-17
R41
Imagen 4Google DeepMind · 官方能力页
R42
Gemini 图像生成Google AI · 当前模型与 Imagen 退役日期
R43
LTX-2 当前仓库Lightricks · 版本与许可 · 核查于 2026-07-17
R44
Sora 2 API 模型页OpenAI · Legacy 状态 · 核查于 2026-07-17
R45
Veo 3.1 Lite Model CardGoogle DeepMind · 2026-04-08
R46
C2PA Technical Specification 2.4C2PA · 当前规范与来源边界
R47
Fréchet Video DistanceUnterthiner et al. · 2018
R48
T2I-CompBenchHuang et al. · 2023
R49
Sora 停用公告OpenAI · API 将于 2026-09-24 停用
研究稿architecture/Diffusion/Diffusion生图生视频深度研究.md

31 章 · 约 1,856 行 · 含公式、Mermaid、模型开放边界、训练/推理工程、评测与 54 项完整证据索引。