跳到正文
2026 FRONTIER · WORLD MODEL / VLA

世界模型不是给未来拍一段电影,而是先在脑中试一遍动作

视频模型问“下一帧长什么样”,世界模型更关心“如果我这样做,世界会怎样变化”。当预测器连接策略、动作和新观察,就形成可学习的闭环;VLA 再把视觉、语言目标映射成机器人动作。两条路线正在靠近,但能生成逼真画面仍远不等于能安全控制真实机器。

桌面机器人观察杯子、午餐盒和苹果,在内部模拟空间中展开多个候选未来,淘汰碰撞路径;选中的短动作经过独立安全闸门执行,新观察再反馈到下一轮预测
直觉总览:世界模型负责在内部比较“做了以后会怎样”,VLA 负责提出动作,安全控制器决定物理系统到底允许执行什么;真实新观察必须不断纠正想象。 查看原图 ↗
01 · 五个基本量

先把“世界”缩成模型能计算的状态转移问题

机器人看不到世界的完整真相,只收到相机、深度、触觉和自身传感器。它要根据这些观察估计当前状态,选择动作,并预测动作之后会发生什么。

OBSERVATION · o

传感器真正读到的

RGB、深度、语音、关节角、力矩等。它通常不完整:被遮挡的物体、摩擦系数和他人的意图并不直接可见。

STATE · s / z

对世界的内部估计

可显式是位置速度,也可是在潜空间里的向量。好的状态要保留完成任务所需信息,而不是复刻所有像素。

ACTION · a

Agent 能改变的量

游戏按键、机器人末端位姿、关节命令或一段 action chunk。没有动作条件,就很难区分世界模型和被动预测。

TRANSITION

接下来会怎样

p(z_next | z, a) 表示当前状态执行动作后,下一个状态的分布。现实有噪声,所以常不是唯一答案。

REWARD / COST

这个未来好吗

离目标更近、耗时更少是奖励;碰撞、越界和不确定是代价。模型也可预测终止与失败概率。

POLICY

下一步做什么

策略 π(a|z,g) 根据状态和目标选动作。它可直接反应,也可调用世界模型比较多条未来再决策。

白话记忆

世界模型像“脑内沙盘”:如果向左绕,会不会撞桌角?如果先挪杯子,抽屉能否打开?沙盘不一定渲染高清画面,只要能准确预测与任务有关的后果就有价值。

02 · Prediction–Action Loop

预测只有回到策略和真实反馈里,才成为系统

世界模型闭环:传感器观察编码成潜状态,策略结合目标生成动作,真实环境执行并返回新观察;内部世界模型根据当前状态和候选动作预测下一个状态与奖励代价,通过多步 rollout 比较未来,选出的动作再回到策略与真实环境验证。
上半部是真实闭环,下半部是内部想象。模型可在潜空间中高速 rollout,但最终必须用真实新观察纠正误差。 查看原图 ↗

编码当前信念

把最近多帧、机器人本体状态和目标压成潜状态。只看单帧难以知道物体速度、门正向哪边移动或动作是否已经生效。

生成候选动作

策略可给出一个动作,也可采样多组 action sequence。复杂任务常先由语言/任务规划器拆高层步骤,再由低层控制器生成连续动作。

在模型内 rollout

用预测的下一状态继续预测,得到多步未来和累计代价。rollout 越长越能看远,但小误差会累积,模型也可能“想象出”训练分布外的有利结果。

执行很短一段,再观察

真实环境只执行选中的一小段动作,立即获取新观察并更新状态。Model Predictive Control 的直觉就是:不断重新规划,不把一次预测当永久真相。

03 · World model vs video generation

“看起来像真的”与“作为环境可用”是两套验收

生成视频可以由文字和首帧驱动,追求视觉质量与运动连贯;交互式世界还要让 Agent 的动作稳定改变未来,并能从环境读取任务状态和结果。

VIDEO

一次性生成轨迹

提示词决定主题,模型给出一条或几条可能视频。用户通常不能每 100ms 改动作并要求环境立即响应。

INTERACTIVE WORLD

按动作逐步演化

环境持续接收 action,保持几何、物体和历史一致,并产生与动作因果相关的下一观察。

CONTROL WORLD MODEL

为决策预测必要状态

不一定输出可见高清帧;预测物体轨迹、接触、奖励或 latent feature 可能更便宜、更适合控制。

反例 · 漂亮但不可控

按“向左”以后,镜头向左动了,却穿过墙、物体位置也变了

作为短视频它可能仍很惊艳;作为训练环境则会教给 Agent 错误因果。世界模型评测要从固定起点重复动作、改变单一 action、检查几何与对象持久性,而不是只让人评价清晰度。

04 · Vision–Language–Action

VLA 把“看图回答”改成“看图后动手”

视觉语言模型通常输出文字;VLA 的输出还包含机器人可以执行的动作。RT-2 把动作离散成类似文本的 token,OpenVLA 也以通用视觉语言主干连接动作预测;后续系统还会用 action chunk 或 diffusion 产生连续控制。

VLA 从数据到真实机器人的流程:互联网图文视频、机器人示教和仿真合成数据共同训练 VLA;模型可结合世界模型预测未来,经动作解码生成 action tokens 或连续 action chunks;独立安全控制层施加速度、力矩、工作区和碰撞硬约束,真实机器人执行后把新观察反馈给模型形成闭环。
蓝绿紫三类数据承担不同角色。红色安全控制层位于模型之外:即使模型误判,也不应绕过速度、力矩、工作区和紧急停止边界。 查看原图 ↗
ACTION TOKENS

把连续动作分桶成编号

可复用语言模型的 next-token 训练与推理,但量化分辨率、不同机器人关节空间和长动作序列会成为挑战。

ACTION CHUNKS

一次输出未来一小段

减少每个控制步都调用大模型的成本,让动作更平滑;chunk 太长则反应迟钝,环境变化时更难纠错。

CONTINUOUS / DIFFUSION

直接生成连续分布

适合多峰动作:同一物体可从左或右抓。采样质量、实时预算与安全约束需要共同设计。

关系而非同义词

VLA 回答“现在做什么”,世界模型回答“这样做以后会怎样”。反应式 VLA 可以没有显式世界模型;规划型系统也可用单独世界模型做风险预测或 imagined rollout。

05 · 数据与 Sim-to-real

互联网给常识,机器人示教给接地,仿真给覆盖

互联网图文与视频:规模大、动作弱

提供物体、语言、视觉关系和人类行为先验,但相机视角、身体结构与动作标签并不等于机器人控制信号。不能把“见过倒水视频”直接当“会安全倒水”。

真实示教:接地强、采集贵

远程操作、手把手示教或自主回放产生观察–动作轨迹。要统一坐标系、动作频率、夹爪定义、成功标签和机器人 embodiment 元数据,否则混合数据会互相冲突。

仿真与世界模型:可大规模试错

能生成危险、稀有和失败事件,也方便读到完整状态。问题是渲染、摩擦、接触、控制延迟和传感噪声不等于现实;生成世界还可能自洽但物理错误。

Sim-to-real:持续校准,不是导出一次权重

做 domain randomization、少量真实适配、影子模式、低速围栏和逐任务放量;真实失败经过安全去标识后进入回归集。评估要按物体、场景、光照、机器人形态和任务阶段分桶。

数据例子 · 同样是“拿起杯子”

桌面高度、杯子材质、夹爪和相机延迟都在改变任务

训练集若全是硬塑料杯、正面相机和低延迟 Franka,部署到透明玻璃杯、腕部相机与另一种夹爪时,视觉和动作分布都会变。跨 embodiment 模型需要显式条件化与真实校准,不能只靠更大的语言主干。

06 · 真实模型坐标

2026 的坐标不止两点:生成世界、推理模型和动作模型正在分层靠近

GENIE 3 · PROJECT GENIE

可实时探索的生成世界

研究发布口径是 720p、24fps、可维持数分钟一致性的导航世界;产品层的 Project Genie 已从 limited preview 扩到合资格 AI Ultra 成年订阅者,仍是 Google Labs 实验原型,不是可下载的机器人模拟器。R04R09

GEMINI ROBOTICS 1.5

直接输出 Action 的 VLA

官方定义是从文本、图像输入产生文本和动作,32K 上下文,面向合作伙伴 private preview;“Thinking”与多 embodiment 是发布方能力描述,不替代具体硬件的闭环安全测试。R08

QWEN-VLA · 2026-05

连续动作与多任务统一

预印本把操作、导航与轨迹预测接到 Qwen 多模态主干,以 DiT 动作解码器生成连续动作,并用文字描述当前 embodiment 与控制约定;论文 benchmark 成绩不等于跨任意机器人即插即用。R10

COSMOS 3 · 2026-05

当前开放的全模态 Physical AI 家族

NVIDIA 用 Mixture-of-Transformers 把语言、图像、视频、音频与动作放进统一模型家族,Reasoner 负责物理理解,Generator 负责扩散式未来观察与动作生成;已发布 16B Nano、64B Super 与 DROID 策略路线。开放模型与训练工作流不等于安全认证,长视频、复杂物理和 action-state 一致性仍有官方限制。R13

OPENVLA · 2024

开放 VLA 基线

7B 模型在 970k 真实机器人 demonstrations 上训练,适合研究动作 token、微调与跨任务泛化;它的特定实验结果不能外推为通用安全机器人。

ROBOTICS-ER 1.6

Embodied Reasoning 不是 VLA

Google 2026-04 更新的 ER 1.6 是增强空间与物理推理的 Vision-Language Model(视觉语言模型,VLM),输出文本;不要因名字里有 Robotics 就把它写成 1.5 的 Action 模型升级版。R12

版本迁移 · Cosmos

Cosmos-Predict2.5 曾把 Text2World、Image2World、Video2World 统一为未来视频预测,但其官方仓库现已明确“不再活跃开发、仅有限维护”,后续模型、功能与社区支持转向 Cosmos 3,并建议用户迁移。因此它只能作为历史视频世界模型基线,不能继续代表 2026-07 的当前 Cosmos 能力。R11

时间与可用性

截至 2026-07-17,Cosmos 3 是 NVIDIA 当前最新开放家族;Project Genie 已不再只是 2025 年的 limited research preview,但仍是订阅内实验原型;Gemini Robotics 1.5 仍为 partner private preview;Qwen-VLA 是 2026-05 预印本。公开演示、论文、订阅体验、API、代码和权重是六种不同证据,不能互相代替。

怎样把两条路线接起来

用生成世界扩充课程,用 VLA 在其中训练,再回真实机器人验证

这是合理研究方向,但中间需要可读状态、动作映射、奖励、重置、物理与安全校验。只把 VLA 放进看似可交互的视频中游玩,无法自动证明训练收益会迁移到现实。

07 · Worked scenario

让双臂机器人“收拾午餐盒”,系统怎样逐步决策

观察与目标

相机看到盒子、苹果、玻璃杯和餐巾,语言目标是“把不易洒的物品装进午餐盒,玻璃杯留在桌上”。状态还包含双臂位置、夹爪开合和碰撞距离。

高层语义分解

VLA 识别可装物体,规划“先移开餐巾 → 抓苹果 → 放入盒子 → 检查是否挡住盒盖”。玻璃杯因任务约束被排除,而不是因模型没识别到。

预测候选抓取

世界模型比较从左、从上两种抓取的未来状态,估计与杯子碰撞、遮挡和抓空概率。若不确定性高,策略先移动相机或轻推餐巾获取新观察。

短 chunk 执行与反馈

动作头输出 300ms 的末端位姿序列,安全层裁剪速度与工作区;执行后重新读视觉和力传感。苹果滑动时不继续播放原轨迹,而是停下并重规划。

成功判定来自环境状态

不是让模型说“完成了”,而是检测苹果位于盒内、杯子仍在桌上、物体无损、盒盖可闭合、没有越过力矩阈值;轨迹和接管事件进入复盘。

08 · 安全与评测

生成质量、预测准确、策略成功和物理安全必须分别过门

WORLD

世界是否可用

动作可控性、对象持久、几何/物理一致、长程误差、状态可读、分支多样与不确定性校准。

POLICY

任务是否完成

闭环成功率、重复运行、跨物体/场景/embodiment 泛化、步数、恢复率、人工接管与失败分类。

SYSTEM

失败是否被限制

P95 控制延迟、速度/力矩/区域硬约束、碰撞与急停、失联行为、权限、日志和可回滚灰度。

模型外安全控制器

工作区、速度、加速度、力矩、禁区和 E-stop 不能靠语言 Prompt 保证。低层控制器应在每个控制周期拒绝越界命令。

不确定时停或主动观察

遮挡、分布外物体、传感器不一致或世界模型预测分歧过大时,选择停机、后退、换视角或请求人工,而不是继续“自信完成”。

仿真红队与真实围栏

在仿真覆盖人突然伸手、物体破裂、网络延迟、相机遮挡和工具掉落;真实测试从隔离场地、低速软物体开始,逐级扩大任务和空间。

09 · 证据边界

“世界模型”仍是一个覆盖很广、口径不完全统一的词

定义边界

本文把能根据状态与动作预测未来、支持策略学习或规划的模型称为世界模型。研究社区也会把可交互生成视频、潜空间动力学、环境模拟器和带奖励预测的 Agent 模型都放入这个词下;阅读论文时应直接检查输入、action、输出与评测。

产品边界

Genie 3 的 720p/24fps/数分钟来自 2025-08 研究发布;Project Genie 的订阅可用性来自 2026-05 产品公告,二者不是同一口径。Gemini Robotics 1.5 在 2026-07-17 仍显示 private preview。它们都没有因此获得“可下载权重”“标准机器人 API”或“通用安全认证”。

Cosmos 边界

Cosmos 3 的全模态与开放性来自 2026-05/06 官方发布;Predict2.5 的 Text/Image/Video2World 能力仍是有效历史事实,但维护状态已经变化。Cosmos 3 能生成动作或未来观察,也不代表任意机器人可直接执行:官方仍列出时间一致、3D 结构、声画对齐、action-state 一致与复杂物理等限制。

迁移边界

仿真、生成环境和 benchmark 成功不能直接外推真实部署。机器人风险取决于硬件、场地、人群和任务;任何物理系统都需要独立安全工程、合规评估与现场验证。

RESEARCH LEDGER

一手来源与证据边界

优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。

R01
World ModelsHa & Schmidhuber · 2018

用压缩视觉模型、记忆模型与控制器学习内部环境动态的经典框架。

R02
Mastering Diverse Domains through World Models (DreamerV3)Hafner et al. · 2023

在潜空间预测并通过 imagined trajectories 训练策略。

R03
Genie: Generative Interactive EnvironmentsGoogle DeepMind · 2024

从无动作标注视频学习可动作控制的生成式交互环境。

R04
Genie 3: A new frontier for world modelsGoogle DeepMind · 2025-08

实时可交互世界、720p/24fps/数分钟口径,以及官方列出的限制与预览状态。

R05
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic ControlGoogle DeepMind · 2023

把机器人动作表示成 token,并迁移视觉语言知识到控制。

R06
OpenVLA: An Open-Source Vision-Language-Action ModelKim et al. · 2024

7B 开放 VLA、970k 真实机器人示教与跨任务微调。

R07
Open X-Embodiment: Robotic Learning Datasets and RT-X ModelsOpen X-Embodiment Collaboration · 2023

跨机构、跨机器人形态的大规模数据混合与泛化。

R08
Gemini Robotics 1.5Google DeepMind · verified 2026-07-17

当前官方 VLA 定义、输入输出、跨 embodiment 能力与 private preview 状态。

R09
Project Genie: now available with Google AI UltraGoogle · 2026-05-19

Project Genie 从 2025 limited preview 走向面向合资格 AI Ultra 成年订阅者的全球逐步开放,仍明确是实验性研究原型。

R10
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot EmbodimentsQwen Team · arXiv 2026-05-28

把操作、导航与轨迹预测统一到 Qwen 多模态主干和 DiT 连续动作解码器,并使用 embodiment-aware 条件。

R11
Cosmos-Predict2.5NVIDIA official repository · limited maintenance notice verified 2026-07-17

历史视频世界模型把 Text2World、Image2World、Video2World 统一;官方现已停止活跃开发、仅有限维护并建议迁移 Cosmos 3。

R12
Gemini Robotics-ER 1.6 — Model CardGoogle DeepMind · updated 2026-04-20

当前 Embodied Reasoning 版本是增强空间与物理推理的 VLM,不应与直接输出 Action 的 Gemini Robotics 1.5 VLA 混写。

R13
NVIDIA Cosmos 3NVIDIA official repository · released 2026-05-31

当前最新 Cosmos 家族:用 Mixture-of-Transformers 统一语言、图像、视频、音频和动作,提供 Reasoner、Generator 与动作/策略路线。