世界模型不是给未来拍一段电影,而是先在脑中试一遍动作
视频模型问“下一帧长什么样”,世界模型更关心“如果我这样做,世界会怎样变化”。当预测器连接策略、动作和新观察,就形成可学习的闭环;VLA 再把视觉、语言目标映射成机器人动作。两条路线正在靠近,但能生成逼真画面仍远不等于能安全控制真实机器。
先把“世界”缩成模型能计算的状态转移问题
机器人看不到世界的完整真相,只收到相机、深度、触觉和自身传感器。它要根据这些观察估计当前状态,选择动作,并预测动作之后会发生什么。
传感器真正读到的
RGB、深度、语音、关节角、力矩等。它通常不完整:被遮挡的物体、摩擦系数和他人的意图并不直接可见。
对世界的内部估计
可显式是位置速度,也可是在潜空间里的向量。好的状态要保留完成任务所需信息,而不是复刻所有像素。
Agent 能改变的量
游戏按键、机器人末端位姿、关节命令或一段 action chunk。没有动作条件,就很难区分世界模型和被动预测。
接下来会怎样
p(z_next | z, a) 表示当前状态执行动作后,下一个状态的分布。现实有噪声,所以常不是唯一答案。
这个未来好吗
离目标更近、耗时更少是奖励;碰撞、越界和不确定是代价。模型也可预测终止与失败概率。
下一步做什么
策略 π(a|z,g) 根据状态和目标选动作。它可直接反应,也可调用世界模型比较多条未来再决策。
世界模型像“脑内沙盘”:如果向左绕,会不会撞桌角?如果先挪杯子,抽屉能否打开?沙盘不一定渲染高清画面,只要能准确预测与任务有关的后果就有价值。
预测只有回到策略和真实反馈里,才成为系统
编码当前信念
把最近多帧、机器人本体状态和目标压成潜状态。只看单帧难以知道物体速度、门正向哪边移动或动作是否已经生效。
生成候选动作
策略可给出一个动作,也可采样多组 action sequence。复杂任务常先由语言/任务规划器拆高层步骤,再由低层控制器生成连续动作。
在模型内 rollout
用预测的下一状态继续预测,得到多步未来和累计代价。rollout 越长越能看远,但小误差会累积,模型也可能“想象出”训练分布外的有利结果。
执行很短一段,再观察
真实环境只执行选中的一小段动作,立即获取新观察并更新状态。Model Predictive Control 的直觉就是:不断重新规划,不把一次预测当永久真相。
“看起来像真的”与“作为环境可用”是两套验收
生成视频可以由文字和首帧驱动,追求视觉质量与运动连贯;交互式世界还要让 Agent 的动作稳定改变未来,并能从环境读取任务状态和结果。
一次性生成轨迹
提示词决定主题,模型给出一条或几条可能视频。用户通常不能每 100ms 改动作并要求环境立即响应。
按动作逐步演化
环境持续接收 action,保持几何、物体和历史一致,并产生与动作因果相关的下一观察。
为决策预测必要状态
不一定输出可见高清帧;预测物体轨迹、接触、奖励或 latent feature 可能更便宜、更适合控制。
按“向左”以后,镜头向左动了,却穿过墙、物体位置也变了
作为短视频它可能仍很惊艳;作为训练环境则会教给 Agent 错误因果。世界模型评测要从固定起点重复动作、改变单一 action、检查几何与对象持久性,而不是只让人评价清晰度。
VLA 把“看图回答”改成“看图后动手”
视觉语言模型通常输出文字;VLA 的输出还包含机器人可以执行的动作。RT-2 把动作离散成类似文本的 token,OpenVLA 也以通用视觉语言主干连接动作预测;后续系统还会用 action chunk 或 diffusion 产生连续控制。
把连续动作分桶成编号
可复用语言模型的 next-token 训练与推理,但量化分辨率、不同机器人关节空间和长动作序列会成为挑战。
一次输出未来一小段
减少每个控制步都调用大模型的成本,让动作更平滑;chunk 太长则反应迟钝,环境变化时更难纠错。
直接生成连续分布
适合多峰动作:同一物体可从左或右抓。采样质量、实时预算与安全约束需要共同设计。
VLA 回答“现在做什么”,世界模型回答“这样做以后会怎样”。反应式 VLA 可以没有显式世界模型;规划型系统也可用单独世界模型做风险预测或 imagined rollout。
互联网给常识,机器人示教给接地,仿真给覆盖
互联网图文与视频:规模大、动作弱
提供物体、语言、视觉关系和人类行为先验,但相机视角、身体结构与动作标签并不等于机器人控制信号。不能把“见过倒水视频”直接当“会安全倒水”。
真实示教:接地强、采集贵
远程操作、手把手示教或自主回放产生观察–动作轨迹。要统一坐标系、动作频率、夹爪定义、成功标签和机器人 embodiment 元数据,否则混合数据会互相冲突。
仿真与世界模型:可大规模试错
能生成危险、稀有和失败事件,也方便读到完整状态。问题是渲染、摩擦、接触、控制延迟和传感噪声不等于现实;生成世界还可能自洽但物理错误。
Sim-to-real:持续校准,不是导出一次权重
做 domain randomization、少量真实适配、影子模式、低速围栏和逐任务放量;真实失败经过安全去标识后进入回归集。评估要按物体、场景、光照、机器人形态和任务阶段分桶。
桌面高度、杯子材质、夹爪和相机延迟都在改变任务
训练集若全是硬塑料杯、正面相机和低延迟 Franka,部署到透明玻璃杯、腕部相机与另一种夹爪时,视觉和动作分布都会变。跨 embodiment 模型需要显式条件化与真实校准,不能只靠更大的语言主干。
2026 的坐标不止两点:生成世界、推理模型和动作模型正在分层靠近
可实时探索的生成世界
研究发布口径是 720p、24fps、可维持数分钟一致性的导航世界;产品层的 Project Genie 已从 limited preview 扩到合资格 AI Ultra 成年订阅者,仍是 Google Labs 实验原型,不是可下载的机器人模拟器。R04R09
直接输出 Action 的 VLA
官方定义是从文本、图像输入产生文本和动作,32K 上下文,面向合作伙伴 private preview;“Thinking”与多 embodiment 是发布方能力描述,不替代具体硬件的闭环安全测试。R08
连续动作与多任务统一
预印本把操作、导航与轨迹预测接到 Qwen 多模态主干,以 DiT 动作解码器生成连续动作,并用文字描述当前 embodiment 与控制约定;论文 benchmark 成绩不等于跨任意机器人即插即用。R10
当前开放的全模态 Physical AI 家族
NVIDIA 用 Mixture-of-Transformers 把语言、图像、视频、音频与动作放进统一模型家族,Reasoner 负责物理理解,Generator 负责扩散式未来观察与动作生成;已发布 16B Nano、64B Super 与 DROID 策略路线。开放模型与训练工作流不等于安全认证,长视频、复杂物理和 action-state 一致性仍有官方限制。R13
开放 VLA 基线
7B 模型在 970k 真实机器人 demonstrations 上训练,适合研究动作 token、微调与跨任务泛化;它的特定实验结果不能外推为通用安全机器人。
Embodied Reasoning 不是 VLA
Google 2026-04 更新的 ER 1.6 是增强空间与物理推理的 Vision-Language Model(视觉语言模型,VLM),输出文本;不要因名字里有 Robotics 就把它写成 1.5 的 Action 模型升级版。R12
Cosmos-Predict2.5 曾把 Text2World、Image2World、Video2World 统一为未来视频预测,但其官方仓库现已明确“不再活跃开发、仅有限维护”,后续模型、功能与社区支持转向 Cosmos 3,并建议用户迁移。因此它只能作为历史视频世界模型基线,不能继续代表 2026-07 的当前 Cosmos 能力。R11
截至 2026-07-17,Cosmos 3 是 NVIDIA 当前最新开放家族;Project Genie 已不再只是 2025 年的 limited research preview,但仍是订阅内实验原型;Gemini Robotics 1.5 仍为 partner private preview;Qwen-VLA 是 2026-05 预印本。公开演示、论文、订阅体验、API、代码和权重是六种不同证据,不能互相代替。
用生成世界扩充课程,用 VLA 在其中训练,再回真实机器人验证
这是合理研究方向,但中间需要可读状态、动作映射、奖励、重置、物理与安全校验。只把 VLA 放进看似可交互的视频中游玩,无法自动证明训练收益会迁移到现实。
让双臂机器人“收拾午餐盒”,系统怎样逐步决策
观察与目标
相机看到盒子、苹果、玻璃杯和餐巾,语言目标是“把不易洒的物品装进午餐盒,玻璃杯留在桌上”。状态还包含双臂位置、夹爪开合和碰撞距离。
高层语义分解
VLA 识别可装物体,规划“先移开餐巾 → 抓苹果 → 放入盒子 → 检查是否挡住盒盖”。玻璃杯因任务约束被排除,而不是因模型没识别到。
预测候选抓取
世界模型比较从左、从上两种抓取的未来状态,估计与杯子碰撞、遮挡和抓空概率。若不确定性高,策略先移动相机或轻推餐巾获取新观察。
短 chunk 执行与反馈
动作头输出 300ms 的末端位姿序列,安全层裁剪速度与工作区;执行后重新读视觉和力传感。苹果滑动时不继续播放原轨迹,而是停下并重规划。
成功判定来自环境状态
不是让模型说“完成了”,而是检测苹果位于盒内、杯子仍在桌上、物体无损、盒盖可闭合、没有越过力矩阈值;轨迹和接管事件进入复盘。
生成质量、预测准确、策略成功和物理安全必须分别过门
世界是否可用
动作可控性、对象持久、几何/物理一致、长程误差、状态可读、分支多样与不确定性校准。
任务是否完成
闭环成功率、重复运行、跨物体/场景/embodiment 泛化、步数、恢复率、人工接管与失败分类。
失败是否被限制
P95 控制延迟、速度/力矩/区域硬约束、碰撞与急停、失联行为、权限、日志和可回滚灰度。
模型外安全控制器
工作区、速度、加速度、力矩、禁区和 E-stop 不能靠语言 Prompt 保证。低层控制器应在每个控制周期拒绝越界命令。
不确定时停或主动观察
遮挡、分布外物体、传感器不一致或世界模型预测分歧过大时,选择停机、后退、换视角或请求人工,而不是继续“自信完成”。
仿真红队与真实围栏
在仿真覆盖人突然伸手、物体破裂、网络延迟、相机遮挡和工具掉落;真实测试从隔离场地、低速软物体开始,逐级扩大任务和空间。
“世界模型”仍是一个覆盖很广、口径不完全统一的词
本文把能根据状态与动作预测未来、支持策略学习或规划的模型称为世界模型。研究社区也会把可交互生成视频、潜空间动力学、环境模拟器和带奖励预测的 Agent 模型都放入这个词下;阅读论文时应直接检查输入、action、输出与评测。
Genie 3 的 720p/24fps/数分钟来自 2025-08 研究发布;Project Genie 的订阅可用性来自 2026-05 产品公告,二者不是同一口径。Gemini Robotics 1.5 在 2026-07-17 仍显示 private preview。它们都没有因此获得“可下载权重”“标准机器人 API”或“通用安全认证”。
Cosmos 3 的全模态与开放性来自 2026-05/06 官方发布;Predict2.5 的 Text/Image/Video2World 能力仍是有效历史事实,但维护状态已经变化。Cosmos 3 能生成动作或未来观察,也不代表任意机器人可直接执行:官方仍列出时间一致、3D 结构、声画对齐、action-state 一致与复杂物理等限制。
仿真、生成环境和 benchmark 成功不能直接外推真实部署。机器人风险取决于硬件、场地、人群和任务;任何物理系统都需要独立安全工程、合规评估与现场验证。
一手来源与证据边界
优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。
用压缩视觉模型、记忆模型与控制器学习内部环境动态的经典框架。
在潜空间预测并通过 imagined trajectories 训练策略。
从无动作标注视频学习可动作控制的生成式交互环境。
实时可交互世界、720p/24fps/数分钟口径,以及官方列出的限制与预览状态。
把机器人动作表示成 token,并迁移视觉语言知识到控制。
7B 开放 VLA、970k 真实机器人示教与跨任务微调。
跨机构、跨机器人形态的大规模数据混合与泛化。
当前官方 VLA 定义、输入输出、跨 embodiment 能力与 private preview 状态。
Project Genie 从 2025 limited preview 走向面向合资格 AI Ultra 成年订阅者的全球逐步开放,仍明确是实验性研究原型。
把操作、导航与轨迹预测统一到 Qwen 多模态主干和 DiT 连续动作解码器,并使用 embodiment-aware 条件。
历史视频世界模型把 Text2World、Image2World、Video2World 统一;官方现已停止活跃开发、仅有限维护并建议迁移 Cosmos 3。
当前 Embodied Reasoning 版本是增强空间与物理推理的 VLM,不应与直接输出 Action 的 Gemini Robotics 1.5 VLA 混写。
当前最新 Cosmos 家族:用 Mixture-of-Transformers 统一语言、图像、视频、音频和动作,提供 Reasoner、Generator 与动作/策略路线。