我亲手把图弄脏
随机抽一张图、一个时刻 t 和一份噪声 ε。答案天然已知:刚才加进去的,就是该学会去掉的。
给真实数据加上我们自己知道的噪声,模型就得到无限道自监督练习题。生成时再把这套方向倒过来用:从随机噪声出发,一小步一小步回到高概率的数据区域。
随机抽一张图、一个时刻 t 和一份噪声 ε。答案天然已知:刚才加进去的,就是该学会去掉的。
U-Net 或 DiT 同时看带噪 latent、时间步和 Prompt,输出噪声、干净样本、score 或 velocity。
Sampler 从 seed 产生的高斯噪声开始,多次调用同一网络。常见结果会先显出低频布局再补高频细节,但具体顺序受模型、条件和采样器影响。
想象一座被雾盖住的山。模型没有背下整张地形图,但它在每种雾度下都学会一支箭头:哪边更像真实世界。大雾时先找山系和山谷,小雾时再找石头纹理。沿箭头走很多次,一张新图就从随机起点里显出来。
这是教学机制演示,不是在线生成模型,也不是所有 checkpoint 的逐步可视化。它用固定随机噪声和分层场景表达一种常见直觉:高噪声更新更偏低频结构,低噪声更新更容易影响边缘与纹理。
状态接近标准高斯噪声;这份教学动画先显出低频方向,但真实模型的更新顺序还取决于条件、主干和采样器。
扩散不是某一年突然冒出的产品名。Score Matching、去噪自编码器、非平衡热力学、SDE、VAE、Transformer 与数值 ODE,二十年里逐渐拼成今天的生成系统。
随机抽 t,一步构造 x_t,网络预测已知噪声;稳定、并行、容易规模化。
先用 VAE 压图,再在潜空间扩散;高分辨率不再要求每一步都处理全像素。
图像变 token,文本与图像共同注意;速度场与更直轨迹让少步采样更有可能。
同一模型吃多参考图、时空 token 与音频 latent,产品开始从“出一张图”走向完整创作流程。
DDPM 最漂亮的工程点,是训练不必真的从第 0 步加到第 1000 步。高斯噪声可以合并,因此任意时刻都能从干净样本一步跳到。
xt = √ᾱt · x0 + √(1 − ᾱt) · ε
L = E[ || ε − εθ(xt, t, c) ||² ]
这里的 c 是 Prompt、参考图或其他控制条件。更完整的变分目标还包含反向条件分布的 KL 项;现代模型也可能预测 x₀、v、score 或 flow velocity。
DDIM、Euler、DPM-Solver 通常不是另一套权重,而是使用同一模型输出的不同数值走法;CFG 则放大 Prompt 带来的方向差。步数和 CFG 都不是越大越好。
机制模拟:色彩、细节和偏移只用于说明参数趋势,不代表任何真实 checkpoint 的输出。
VAE 决定压缩与还原质量,U-Net / DiT 决定内容、关系和运动。压得越多越省,但小字、小脸、细线和短促动作越容易在编解码时丢失。
卷积多尺度先验强,像从局部纹理一路缩到全局构图,再带着 skip connection 返回细节。
把 latent 切成 patch token,用 Transformer 一次处理整块状态;它不是逐 token 自回归。
文本与图像各有参数,又在 joint attention 中共同看彼此,适合更强多模态条件。
Flow Matching 直接学习连续概率路径的速度场;Rectified Flow 尝试把噪声到数据的运输轨迹拉直。它与 DDPM 数学目标不同,却共享 latent、DiT、条件、solver、CFG 和蒸馏生态。
训练目标常是噪声、v 或 score;推理可以走随机反向 SDE,也可以走确定性 probability-flow ODE。
网络输出 velocity,ODE solver 沿速度场积分;Rectified Flow 希望这条运输路线尽量少绕弯。
探索构图、保持原图、只改局部、固定姿态、记住角色、组合参考图,是六种不同问题。把条件分工,成功率比盲目堆 Prompt 高得多。
“我只说想要什么,其他都让模型决定。”
黄色雨衣的柯基,雨夜霓虹,低机位。
“沿用这张图,但把它往另一个方向推。”
把白天街景改成雨夜,保持道路和建筑。
“只准改这个区域。”
只把杯子的蓝色把手改成木质。
“姿态、边缘或深度必须照这张施工图。”
固定芭蕾舞姿态,再换成厚涂油画。
“让模型记住这个风格或具体主体。”
同一只柴犬穿宇航服出现在火星。
“用自然语言组合一张或多张参考图。”
保留人物身份,换服装,并借用另一图的材质。
一段 5 秒、24 FPS 的视频有 120 帧。模型不仅要让每帧好看,还要让主体、动作、遮挡、镜头、物理和声音在时间上连续。
人物结构、材质、光影和背景细节。
身份、纹理和配饰不能随机跳变。
碰撞、遮挡、重量和镜头运动要合理。
对白、口型、脚步与环境声需要同步。
缺时长、运动方向、镜头运动、交互事件、身份保持和禁止切镜。视频 Prompt 要像一个小分镜,而不是一串静态名词。
6 秒连续镜头。雨后的老城区石板路,一只红色折纸船顺着水沟从左下漂向右上;摄影机低机位贴近水面缓慢跟拍;纸船绕过一片梧桐叶时轻微旋转 30 度;阴天柔光,无切镜,无慢动作。
分辨率长宽都翻倍,面积先变四倍;视频再乘帧数。全局 attention 还可能平方增长。少步 solver、蒸馏、高压缩 VAE、稀疏 attention、量化和缓存是在不同层级省钱。
代表性流水线,不是统一标准。视频数据通常更少、更脏、更难描述。Stable Video Diffusion 把“图像预训练 → 视频预训练 → 高质量视频微调”与数据筛选列为关键;Sora 报告使用 recaptioning 让训练文字更像分镜。
不重训模型,用高阶 ODE 方法跨更大步;极少步仍受轨迹误差限制。
step / consistency / guidance distillation 可把几十步压到 1~8 步。
更高 VAE 压缩、更大 patch 更省,但小字与短促动作更容易损失。
稀疏 attention、缓存、FP8/INT8、context parallel 与异步 VAE 各解决一层瓶颈。
有论文不等于能私有化,可下载不等于可商用。闭源模型可以讨论公开能力,但厂商没写出的架构不能靠行业传闻补齐。下面每个模型都补一个具体任务和 Prompt,帮助你把规格翻译成真实用法。
Large / Turbo / Medium,适合开放工作流、LoRA 与消费级部署;它是开放权重,不是无条件开源。
注意组织年营收低于 100 万美元时可按 Stability Community License 免费商用;达到 100 万美元时应联系 Stability 获取 Enterprise License,纯研究例外另见条款。复杂中文、多人小脸与品牌字仍要逐字验收。
32B dev 与 4B/9B klein;生成、单参考和多参考进入同一产品线。4B / 4B Base 为 Apache-2.0;9B、9B KV、9B Base 与 dev 权重采用 FLUX Non-Commercial License。
注意9B 与 dev 权重仅限非商业、非生产用途,生产部署需另行授权;输出能否商用仍须遵守许可条款。4B 官方约 8GB 显存,不能外推到 9B/32B。
面向长指令、2K、中文与文字密集内容;论文与产品已公开,但官方仓库截至 2026-07-17 未提供 2.0 checkpoint。
注意“擅长文字”不等于任意小字号都准确,发布前仍要逐字校验。
即 Gemini 3.1 Flash Image,官方提供最高 4K 输出。Imagen 4 已弃用,并计划于 2026-08-17 关闭。
注意闭源能力页不能证明它沿用 Imagen 的 Diffusion 架构;迁移时还要重新验收文字、计数、小脸与细结构。
A14B 含两个各约 14B 的专家、每步只激活一个,合计约 27B;另有可在 24GB 显存配合 offload 运行的 5B TI2V,以及 S2V、Animate 分支。
6 秒连续镜头。雨夜便利店门口,黄色雨衣的柯基从左向右跑过积水;低机位平行跟拍,水花只在落脚处溅起,霓虹倒影连续,无切镜。
注意官方单卡 A14B 命令要求至少 80GB,5B 的 24GB 口径含 offload;两者的显存、速度和能力不能混成一个数字。
查看官方资料 ↗支持 T2V / I2V、多时长与多分辨率;官方最低 14GB 显存需开启 offload,另有 8/12 步 I2V 蒸馏版。
以商品首图为第一帧:磨砂银耳机静置在黑色石材上,摄影机缓慢环绕 25 度;一道窄光从左向右扫过外壳,商品比例和 Logo 不变。
注意许可不适用于欧盟、英国、韩国;发布日前一月全产品/服务合计 MAU 超 1 亿需先取得额外许可,且不得用模型或输出改进非混元 AI 模型。“14GB”还依赖 offload。
查看官方资料 ↗论文的非对称双流 Transformer 用双向 Cross-Attention 联合生成音视频;当前官方仓库已迭代到 LTX-2.3,并发布 22B checkpoint。
8 秒固定中景。深夜修车铺里,技师放下扳手说“发动机终于安静了”;远处雨声持续,金属扳手落桌发出清脆一声,嘴型与对白同步。
注意论文的 14B+5B 不能当作当前 22B checkpoint 的参数拆分;年营收达到 1000 万美元的组织还需另购商业许可。
查看官方资料 ↗系统卡披露物理、写实度、同步音频与可控性方向;消费端 Sora 已于 2026-04-26 退役,Sora API 将于 2026-09-24 停用。
10 秒手持纪录片镜头。滑板手冲上湿滑 U 型池,在最高点抓板旋转后落地;轮子触地声、观众短促欢呼与镜头晃动同步,人物服装全程一致。
注意必须在 2026-09-24 前完成迁移与产物归档;“物理更准确”也不是物理模拟器承诺。
查看官方资料 ↗官方提供参考图、角色一致、场景延展、相机控制、首尾帧、对象增删与原生音频;Veo 3.1 Lite 模型卡于 2026-04-08 发布。
首帧是清晨空荡站台,末帧是夜晚同一机位的灯火列车;8 秒固定镜头完成昼夜过渡,站台结构不变,列车刹车声在末段由远及近。
注意官方仍把短对白自然度与同步列为持续改进项;内部人评结果不能直接替代你的业务盲测。
查看官方资料 ↗同一个模型面对商品、人物、对白、转场、物理和长故事,难点完全不同。下面的 Prompt 是教学例子;候选模型表示能力形态匹配,不是质量排名。
候选:Wan2.2 I2V · HunyuanVideo 1.5 · Veo 3.1
6 秒,白色背景的银色咖啡机保持形状和铭牌不变;镜头从正面缓慢横移到右前 30 度,蒸汽在第 4 秒升起,柔光棚拍,无切镜。
验收:外形、Logo、按钮数量、反射方向和镜头轨迹。
候选:HunyuanVideo 1.5 · Wan2.2 I2V · Veo 3.1
5 秒近景。人物保持直视镜头,只轻轻眨眼一次并呼吸;发梢被微风向右吹动,背景树叶轻摆,摄影机固定,不转头,不露齿。
验收:五官、耳饰、发际线、手指与背景纹理是否跨帧稳定。
候选:LTX-2 · Sora 2(迁移截止 2026-09-24)· Veo 3.1
8 秒中景。雨夜出租车内,司机看着后视镜说“前面封路,我们绕一下”;雨刷每两秒扫过,车内低频引擎声持续,对白清楚,无背景音乐。
验收:台词可懂度、嘴型起止、雨刷节奏、环境声连续和人物身份。
候选:Veo 3.1 · 支持关键帧的工作流
从纸上铅笔画的城市天际线,平滑过渡到同构图的真实夜景;建筑轮廓逐步立体化,镜头固定,不新增高楼,最后一秒稳定停在尾帧。
验收:起点、终点、共同结构、过渡路径和末帧停留。
候选:Sora 2(迁移截止 2026-09-24)· Veo 3.1 · Wan2.2
7 秒低机位。玻璃弹珠从木坡滚下,只撞击一次红色积木;积木倒向右侧,弹珠减速停在桌边,摄影机不移动,其他物体保持静止。
验收:碰撞顺序、速度变化、物体永久性、接触阴影和是否凭空增物。
候选:Veo 场景延展 · 多模型剪辑工作流
镜头 A:侦探推门进入档案室。镜头 B:同一人物近景发现红色文件。镜头 C:走廊灯熄灭。每个镜头 5–8 秒,分别生成,再用尾帧、环境声和色彩统一衔接。
验收:角色锚点、空间方向、道具状态、色温、声音底噪与剪辑连续性。
第一轮先做 5–8 秒、单镜头、单主事件。如果这一层都不稳定,直接要求 30 秒多镜头故事,只会把身份漂移、物理错误和声音错位叠在一起。长故事应拆成镜头表,再用参考图、尾帧、场景延展、声音底轨和剪辑统一。
Qwen-Image-2.0 有论文和产品,但官方仓库没有 2.0 checkpoint;Nano Banana 2 的完整网络未披露,不能因上一代 Imagen 而擅自标成 Diffusion;LTX-2 论文的 14B+5B 双流与当前 LTX-2.3 22B checkpoint 是两条版本证据;Sora 2 消费端已退役、API 将于 2026-09-24 停用,也不能继承 Sora 1 的全部架构描述;Veo 3.1 的发布方内部人评不能替代业务盲测。
图片要拆质量、对齐、文字、身份、编辑保持与安全;视频再加运动、闪烁、物理和音画同步。真正的业务评测还要固定采样次数,不挑最好结果。
“三只杯子,红在蓝左侧”同时考计数、实例、颜色和空间绑定。模型可能概念都懂,却把绿色涂给两只杯子。
图像 loss 更在意整体感知,VAE 又压掉小字高频;准确字符、排版、透视和材质必须同时成立。
每帧单看都像真的,毛发、墙面和水纹却在相邻帧随机变化;逐帧后处理还可能把问题放大。
角色转身、出画再回来,需要模型保存不可见期间的身份状态;长时长和多人交叉遮挡尤其难。
模型学到视频统计规律,不是刚体求解器;碰撞、重量、物体永久性和因果顺序仍可能失败。
许多 latent 编辑流水线会重复编解码与采样,未指定区域也可能变化;应保留原图、遮罩、参考条件和完整编辑历史。
训练数据、真实人物、未成年人、误导性事件、商标与传播来源贯穿整条链。现代系统通常同时做输入检查、生成中约束、输出帧/音频检查、账号治理和 provenance。
Prompt、参考图与真实人物授权;不要只做关键词黑名单。
模型内拒绝、安全条件、未成年人和真实人物的专门限制。
最终图片、视频帧、音频转写和场景描述都要再次检查。
隐形水印、C2PA/内容凭证、服务日志与平台展示组合使用。
来源不等于事实。C2PA / 内容凭证回答“文件从哪里来、经历过什么声明”,不能证明画面描述的事件真的发生;清单还可能被剥离,软绑定或水印也会受截图、裁剪、压缩和转码影响。应组合密码学来源、平台标签、内容核验与审计链。
一个开放 base 模型可能单张分数不最高,却因 LoRA、ControlNet、许可与返工链路更适合你;一个闭源 API 也可能因稳定性与安全栈降低总成本。
不用。训练随机抽一个时刻 t,用闭式公式从干净样本一步构造带噪样本,只做一次网络前向和一次 loss。推理才需要按多个时刻顺序更新。
权重学习的是跨样本的方向函数,seed 只是随机噪声起点,不是图库编号。但高度重复或独特训练样本仍可能被记忆,因此“不是检索”不等于“绝不近似复现”。
Diffusion / Flow 定义生成路径和训练目标;U-Net、DiT、MMDiT 是表示噪声场或速度场的神经网络骨架。换成 DiT 后依然是迭代生成。
严格数学上它不等于传统 DDPM,而是直接学习连续概率路径的速度场。工程生态里它继承 latent、DiT、CFG、solver、蒸馏和编辑工具,因此常被归入广义 diffusion 生成系统。
独立生图没有共享时序状态,同一个人的脸、衣服和背景纹理会逐帧随机变化。视频模型要联合处理时空 latent,或加入 temporal attention / convolution。
不一定,必须跟 checkpoint 和 scheduler 的训练配方走。例如 FLUX.2 klein distilled 以 4 步为目标,Base 配方约 50 步;HunyuanVideo 1.5 常规版与 8/12 步 I2V 蒸馏版也不是同一条轨迹。
首帧减少了外观、构图、材质与光线的不确定性,所以往往比纯文本更容易控制;它仍不保证身份、遮挡、运动或物理连续,必须逐帧验收。
训练时随机给真实图片或视频 latent 加不同强度的噪声,让网络预测噪声、干净样本或速度方向;推理时从随机噪声开始,采样器多次调用 U-Net/DiT 逐步生成。视频再把 latent 扩展为时空 token,联合保持跨帧一致性。
理论与架构只采用论文、作者项目页、官方报告、官方模型卡和官方代码仓库;动态产品、许可证与退役状态截至 2026-07-17。完整 1,856 行研究底稿已先于网页落盘。
31 章 · 约 1,856 行 · 含公式、Mermaid、模型开放边界、训练/推理工程、评测与 54 项完整证据索引。