继续追寻中本聪的脚步

具身智能方向:VLA「直觉派」快,错误多。世界模型「深思派」慢,太贵。合并WAM,世界动作模型@黎曼动力-昆仑万维@量子位

具身智能为什么需要世界模型?从Riemann-1.0看机器人如何学会干活

具身智能要解决的,不只是让机器人看懂一句指令,而是让它理解:一个动作会怎样改变物理环境,下一刻世界又可能变成什么样。

语言模型可以在屏幕里回答问题,但机器人真正进入家庭和工厂后,还要面对餐具会滑、布料会变形、物体会遮挡、动作可能失败等现实问题。

世界模型负责预测环境如何变化,动作模型负责把这种理解转化为机器人可以执行的控制信号。Riemann-1.0展示的,正是一条把两者结合起来的路线:先从海量人类视频中学习物理规律和操作常识,再用真实机器人数据完成动作对齐。

Riemann-1.0由黎曼动力推出,并在WAIC 2026上正式发布。根据团队公开结果,它在长序列家务评测RoboCasa-365中取得62.6%的成功率,较材料中列出的此前最佳结果提高8.4个百分点。

比跑分更直观的是真机演示。机器人收拾餐桌时,能够夹起贴在桌面的勺子,先倒掉碗里的残留液体,再把餐具收走,最后完成桌面擦拭。

这类任务难的地方,不是单独完成一次抓取,而是连续理解环境、判断动作顺序,并在前一步改变环境后继续执行下一步。

黎曼动力背后是昆仑万维,前者是其面向具身智能方向成立的子公司。

一个刚进入公众视野的模型,为什么能在复杂家务任务上取得这样的成绩?

答案藏在它的训练数据和训练方式里:

23.2万小时训练数据中,占最大比例的并不是机器人数据,而是人类做饭、叠衣服、整理桌子等第一视角视频。

具身智能为什么需要世界动作模型

VLA与世界模型:两条路线正在合流

为什么机器人开始学习人的视频?

这要从具身智能领域长期存在的路线分歧说起。

VLA和世界模型,代表了两种不同的机器人智能路径。

两派各有优劣。

简单总结就是:

对比维度 VLA

视觉-语言-动作
看到什么,就执行什么
World Model

世界模型
理解未来,再决定行动
核心思路 端到端动作生成

 

输入当前视觉 + 语言指令

 

 

直接输出下一步机器人动作

预测式决策

 

输入当前状态 + 指令

 

 

模拟未来 → 决策动作

代表玩家
π
Physical Intelligence
Pi 系列
NVIDIA
GROOT
机器人基础模型
👤
Yann LeCun
世界模型倡导者
NVIDIA
Cosmos
世界模型平台
优势
链路短,响应快
训练部署简单
适合明确任务
成本较低

理解物理规律
预测未来结果
长任务能力强
更接近人类智能
一句话总结 速度快
但容易翻车
更稳健
但成本更高

VLA属于「直觉派」,快但容易翻车;世界模型属于「深思派」,稳但是又慢又贵。

随着研究深入,越来越多团队发现:

两条路线并不是非此即彼,而是可以互相补充。

于是,VLA与世界模型开始走向融合。

英伟达西雅图机器人实验室在2026年6月发布的相关综述中,给出了一个值得关注的判断:

World Action Model(WAM,世界动作模型)已经从VLA研究里的小众分支,迅速长成了机器人基础模型的第二条主路线,而下一代机器人基础模型,大概率是两者的混合体。

ICML 2026上,包括LeCun团队在内的多篇论文也在往同一个方向推进:

从海量无标注的野外视频(in-the-wild videos)里学习潜在动作世界模型。

把这些工作放在一起看,一条正在被越来越多团队验证的训练范式浮出水面:

先用大规模开放世界视频做预训练,让模型看遍人类怎么和物理世界打交道,攒够物理直觉;再用少量真实机器人数据做动作对齐,把直觉翻译成可执行的控制信号。

为什么机器人开始学习人类视频

对机器人来说,人类的日常生活本身就是一场持续发生的操作示范。

做饭、叠衣服、整理房间等第一视角视频,记录了人类如何观察环境、安排动作顺序、接触物体并处理意外情况。

与昂贵的机器人真机数据相比,这类视频规模更大、场景更多,也更容易持续获得。

一些前沿团队已经开始沿着这条路线探索。

比如Being-H0.7用了20万小时第一视角人类视频,Generalist AI的GEN-1更是砸了50万小时可穿戴设备采集的人类数据。

Riemann-1.0的特点在于:

它尝试把“人类视频预训练—动作轨迹提取—真实机器人对齐”这条路线完整工程化,并同时在仿真和真机任务中进行验证。

而它之所以能跑通,关键在于解决了一个核心难题:

人类视频里没有机器人动作标签。

这也是这条路线最难解决的问题。

人叠衣服的视频看得再多,机器人手臂该转多少度、夹爪该用多大力,视频里一个字都没写。

换句话说,机器人可能看懂人在做什么,却仍然不知道自己的关节和夹爪应该怎样运动。

20万+小时人类干活的视频,怎么变成机器人手上的活儿?

这正是Riemann-1.0故事的起点。

Riemann-1.0如何把人类视频变成机器人能力

核心问题是:23.2万小时视频,怎样一步步变成机器人可以执行的能力?

Riemann-1.0是一款面向通用机器人操作的世界动作模型(World Action Model,WAM)。

从功能上看,它正是前文所说的“混合体”:

它既学习直接生成机器人动作,也学习预测动作发生后环境会怎样变化。

而它要攻克的,正是行业面前那道共同的坎:

怎么把没有动作标签、来源五花八门的开放世界数据,变成机器人可执行的控制能力,而且要跨机器人本体通用。

Riemann-1.0的解法,用做菜来类比,可以拆成三步。

第一步:准备训练数据,也就是“备料”

如果把训练模型比作做菜,数据就是最基础的食材。

Riemann-1.0使用了三类互补的数据:

  • 「广菜」:20万+小时人类第一视角视频;
  • 「精菜」:1.2万+小时UMI与外骨骼手套数据;
  • 「准菜」:2万+小时机器人真机与仿真轨迹。

三种数据来源,23.2万小时训练数据,覆盖41种机器人本体、数千种交互方式。

三类数据合计23.2万小时,既提供开放世界中的场景多样性,也提供可以用于控制学习的精确动作信息。

Riemann-1.0 的 23.2 万小时训练数据
三条数据流,
广
·

·
覆盖
41
种机器人本体,支持
数千种交互方式
广
人类第一视角视频
规模最大、场景最广
UMI 与外骨骼手套数据
数据干净、动作质量高
机器人真机与仿真轨迹
监督直接、轨迹精确
20万+ 小时
做饭、叠衣服、收拾桌子
场景和行为多样性拉满

做饭、叠衣服、整理桌面等人类第一视角视频样例

1.2万+ 小时
最干净的手腕视角
自带末端执行器动作

UMI、外骨骼手套与传感器数据样例

2万+ 小时
最直接的动作监督
但采集贵、场景窄

机器人真机和仿真轨迹数据样例

视角 乱:移动、复杂、多变
标签 无动作标签
特点 场景广泛、行为多样、数量最大
视角 干净:手腕视角
标签 自带末端执行器动作
特点 量少但质量最高,数据最干净
视角 固定:多为第三视角
标签 有精确动作/轨迹标签
特点 动作精确、成本高、场景窄
三条数据流互补
广泛覆盖

高质量动作

精准监督
融合训练
共同构建机器人世界模型与动作能力
Riemann-1.0
更强泛化性  |  更稳健执行  |  支持多本体
覆盖 41 种机器人本体

多种机器人本体示意

手机端可左右滑动查看完整三列对比。

 

不过,食材多,不等于能直接开席。

尤其是占大头的那道「广菜」:

20万+小时人类视频,没洗没切,连动作标签都没有,没法直接下锅。

怎么办?下一步就是清洗、切分和标注这些视频。

第二步:清洗和标注人类视频,也就是“备菜”

黎曼动力为此设计了一套自动化人类视频处理流水线。
下面可以沿着一段第一视角视频的处理过程,理解这条流水线在做什么:

机器人训练数据清洗与标注流程
从原始第一视角视频,到高质量、可用于训练的数据池
阶段 阶段名称 核心处理流程 判断与输出 UMI 与机器人扩展

1
视觉预处理
Visual Pre-processing
原始第一视角视频 鱼眼畸变校正 画面方向校正

输出标准化视频

修正镜头变形、旋转方向与画面姿态,为后续标注提供统一输入。
UMI 与机器人扩展流程
末端执行器状态
动作边界校准
机器人专用过滤器
· 运动形态过滤
· 静止片段过滤
· 空闲动作过滤
· 异常轨迹过滤
· 其他机器人专用规则
机器人数据经过独立校准和过滤后,与人类第一视角数据共同进入最终训练数据池。

2
指令标注与动作切分
Instruction Annotation & Action Segmentation
基于 VLM 的层级化切分
任务切分 任务一致性检查 动作标注 动作一致性检查

输出动作片段

将长视频切分为结构清晰、任务明确、动作边界相对准确的短视频片段。

3
质量过滤
Quality Filtering
VLM 自动检查以下问题
多人出现 无意义动作 关键区域遮挡
动作未完成 非第一视角 手部离开画面

不合格片段丢弃

仅保留主体明确、视角有效、动作完整且可学习的视频片段。

4
三维手部运动标注
3D Hand Motion Annotation
手部检测 手部跟踪 初步过滤
三维手部重建 相机位姿估计 时间平滑

输出重建后的手部轨迹

得到连续、稳定的三维手部姿态与运动信息。

5
几何过滤
Geometric Filtering
手部可见度评分 手部运动速度 相机运动与抖动

去除几何质量异常数据

排除手部不可见、速度异常、相机剧烈晃动等不稳定片段。

6
数据平衡
Data Balancing
四级语义分类
场景 任务 动作 相关物体

按比例重新采样

调整不同场景、任务、动作及物体类别的数据占比,避免训练数据分布失衡。
高质量训练数据池
视觉校正

任务与动作切分

质量过滤

三维手部重建

几何过滤

语义平衡
Curated High-Quality Data Pool for Training
手机端可左右滑动查看完整流程,所有内容均为 HTML 文字,无图片依赖。

一段「人在厨房切菜的第一视角」视频进厂,第一件事是摆正。

鱼眼镜头的畸变、歪了倒了的画面,统统矫正成正视图,方便后面处理。

接着VLM上场,把长视频切成一个个细粒度动作,给每一段配上任务描述、动作指令、场景和物体信息。

切完还得过两轮一致性校验,标得对不上的,推倒重来。

切好的片段紧接着过质检。

画面里人太多的、动作没意义的、遮挡严重的、活儿没干完的、不是第一视角的、手出了画面的,六类废片,直接进垃圾桶。

活下来的片段,迎来整条流水线上最核心的一步:

给手建3D模。

系统检测并追踪画面里的手,重建出完整的手部姿态,再配合相机位姿估计,把手的运动轨迹换算进世界坐标系,最后做整段平滑。

到这一步,视频里「手怎么动」,第一次变成了机器可读的3D坐标。

当然,重建的质量也得把关。

手看不清的、动得太快的、镜头晃太狠的,按阈值再筛一轮,和前面的语义质检互为补充。

最后一步是装盘:

按场景、任务、动作和相关物体等语义维度分类,再重新调整数据比例,避免模型过度偏向少数高频任务。

一段段视频这样走下来,海量「人类干活的录像」,就变成了一本机器人能读懂的「动作教材」。

另外,UMI、外骨骼手套和机器人轨迹通常自带更明确的末端执行器或控制信息,处理方式相对成熟,本文不再展开。

第三步:联合学习视频变化和机器人动作,也就是“炒菜”

数据准备完成后,接下来要解决的是模型架构和训练策略。
在架构上,Riemann-1.0采用扩散式生成框架,将视觉变化、环境状态和机器人动作序列放进同一个过程中联合学习。

这意味着,模型不只是知道「眼前看到了什么」,还在学习:

动作会如何改变环境,以及下一刻世界可能变成什么样。

而为了让同一个模型适配41种不同形态的机器人本体,Riemann-1.0进一步设计了本体专属的动作映射模块:

共享对世界的理解,同时保留不同机器人的「肢体适配能力」。

可以把它理解为一个共享的“世界大脑”:主体模型负责理解环境并预测变化,不同机器人的动作映射模块再把这种理解转化为各自可以执行的控制信号。

Riemann-1.0 Architecture
统一的视频—动作动力学建模架构
多视角视觉观测

结构化任务提示

机器人本体 ID

统一轨迹 Token

Action / Video DiT

潜变量与动作预测
架构模块 输入或表示 核心处理 输出 作用

多视角视觉观测

Multi-view Observation
Context
当前时刻的多摄像头画面
Future
后续多个时间步的视频帧
WAN VAE
3D Patch Embedding

z0

:上下文潜变量

z1:F

:未来视觉潜变量
将高维视频压缩成逐帧视觉潜变量 Token,为未来视频预测提供紧凑表示。

结构化提示词

Structured Prompt
视频由指定机器人本体录制,展示对应摄像头视角,机器人正在执行指定任务。
T5 Encoder
Prompt Embedding
语言任务条件 Token 告诉模型机器人本体、摄像头视角以及当前任务。

机器人本体 ID

Embodiment ID
不同机器人平台的类别编号,例如:

0:Franka
1:WindowX
2:其他机器人本体
将本体类别编码作为条件输入,参与统一的视频—动作动力学建模。 本体条件表示 允许同一个模型支持不同机械臂、移动机器人和执行器。

统一轨迹 Token

Unified Trajectory Tokens
· 上下文视觉潜变量
· 干净的未来潜变量
· 加噪未来潜变量
· 状态 Token
· 干净动作 Token
· 加噪动作 Token
[z0,
zclean1:F,
1:F,
s0:F,
aclean1:F,
1:F]
视觉潜变量按帧生成;状态与动作 Token 通过类别专属线性投影得到。
同一序列中的视觉、状态与动作表示 将视频预测和机器人动作预测统一为同一种序列建模问题。

位置与时间条件

CaPE / TimePE / AdaLN
不同类型 Token 的空间位置、帧序号和扩散时间步。

CaPE:坐标感知位置编码

视觉:(frame, h, w)
状态:(F+1, 1, 1)
动作:(F, apf, 1)

TimePE + AdaLN

上下文/状态时间步 = 0
干净 Token = 条件时间步
加噪 Token = 采样噪声时间步
空间、时间和噪声条件编码 帮助模型区分不同帧、不同空间位置、状态、动作以及扩散噪声阶段。

统一动力学模型

Unified Video-Action Dynamics
视觉潜变量 z、机器人状态 s、机器人动作 a,以及语言和本体条件。
Action / Video DiT Blocks
在结构化因果可见性约束下,联合建模 z、s 和 a Token
共享的时空动力学特征 同时学习“世界如何变化”和“机器人应该如何行动”。

上分支:潜变量预测

Latent Prediction
DiT 输出的视觉潜变量特征
Shared Latent Velocity Head
潜变量速度 Vz
[B, Cz, F, Hz, Wz]

Masked Latent Loss
预测未来视觉潜变量,即未来画面和环境变化。

下分支:动作预测

Action Prediction
DiT 输出的动作特征与机器人本体 ID
Embodiment-Specific
Action Velocity Head
动作速度 Va
[B, Da, F, apf, 1]

Masked Action Loss
针对不同机器人本体输出对应的动作轨迹。

UMI 与机器人扩展

UMI & Robot Extension
末端执行器状态及真实机器人动作数据
末端执行器状态
动作边界校准
机器人专用过滤器
静止动作、空闲片段及异常轨迹过滤
校准后的状态与动作 Token 将 UMI 和真实机器人动作统一到模型使用的控制空间。

加权动力学损失

Weighted Dynamics Loss
潜变量损失 Lz
动作损失 La
L = (1 − λ)Lz + λLa
单一联合训练目标 通过 λ 调整视觉动力学学习与机器人动作学习之间的权重。
手机端可左右滑动查看完整架构。

模型架构决定“怎么学”,三阶段训练策略则决定“先学什么、后学什么”。

训练分三段,秘诀藏在一组数字里:

动作损失权重0.1→0.5→0.9。

第一阶段:潜动作预训练(小火慢炖)

使用Latent Action Model从海量人类视频中提取伪动作信号,动作损失权重设为0.1,让模型优先学习画面变化和物理世界的运行规律。

第二阶段:真实轨迹对齐(中火调味)

引入UMI、三维手部轨迹和真实机器人动作进行校准,将动作损失权重提高到0.5,使伪动作表示逐步过渡到真实控制空间。

第三阶段:机器人策略强化(大火收汁)

最后只使用高质量机器人数据继续训练,将动作损失权重提高到0.9,重点强化真实机器人执行能力。

从「以理解世界为主」渐进切换到「以执行动作为主」,有点像大模型训练里从预训练到对齐的路径,只不过载体从文本换成了物理世界的动作。

Riemann-1.0 三阶段训练策略
从大规模无标注视频学习,逐步过渡到真实机器人策略强化
阶段 阶段名称 使用数据 核心训练方法 损失权重 主要目标

1
LAM-Action Bootstrap
潜动作启动阶段

大量无标注人类第一视角视频

视频中没有真实机器人动作标签,通过潜动作和潜状态进行训练。
使用潜动作 Token 和潜状态 Token 扩大训练规模。

无标注视频

LAM 生成伪动作
λ = 0.1
优先学习视觉动力学

Scalable Data

利用海量人类视频扩展训练数据规模。

2
Trajectory-Grounded Alignment
轨迹对齐阶段
· UMI 数据
· 真实机器人数据
· 带三维手部姿态的人类第一视角视频
将伪动作逐步映射到真实机器人动作空间。

伪动作

三维手部轨迹

真实机器人动作
减少人类视频数据与真实机器人控制数据之间的分布偏移。
λ = 0.5
视觉与动作平衡学习

Stable Training

建立稳定、连续的伪动作到真实动作过渡。

3
Robot-Policy Enhancement
机器人策略强化阶段

仅使用高质量真实机器人数据
在真实机器人数据上继续训练,并显著提高动作损失的权重。

Robot-only Training

更高动作损失权重
λ = 0.9
聚焦机器人策略与动作

Stronger Policy

提升真实机器人任务中的动作精度和策略性能。

LAM 从无标注视频生成伪动作

真实轨迹完成控制空间对齐


高动作权重的机器人专属训练强化策略性能

手机端可左右滑动查看三个训练阶段。

人类视频到底带来了多大提升

现在回到最关键的问题:

使用人类视频预训练,是否真的能提升机器人的操作能力?

公开的消融实验给出了比较直接的结果。

在专门考察长序列家务能力的RoboCasa-365上:

  • 模型从头训练,成功率38.2%;
  • 加机器人数据预训练,43.4%,涨5.2个百分点;
  • 再加UMI数据,48.2%,又涨4.8个百分点。

然后,加入人类视频数据:

62.6%。

相较于加入UMI数据后的48.2%,成功率进一步提高14.4个百分点。

团队对此的解释是:

这说明人类数据带来的远不止「更多训练样本」,它给模型灌进了更丰富的物体交互方式、动作语义和任务先验,直接抬高了模型在没见过的场景里的泛化上限。

另一组控制变量实验也显示了类似趋势。

在专为双灵巧手人形机器人设计的EgoVLA基准测试中,同样的模型、同样的机器人数据,仅仅比较加不加人类视频预训练:

  • 长程多阶段任务的成功率从42.96%提升到71.11%,提高约28个百分点;
  • 换成完全没见过的视觉背景,也从26.36%提升到43.33%。

这些结果说明,任务链越长、场景越陌生,人类视频中包含的操作先验越有价值。

搞定这个基础性问题,最后来看整体成绩单。

仿真评测结果

模型在三项仿真评测中的公开结果如下:

  • LIBERO:业内常用的标准操作评测,考基本功,Riemann-1.0成功率99.0%;
  • RoboTwin 2.0:主打双臂协作任务的仿真基准,成功率94.3%;
  • RoboCasa-365:面向长流程家务任务的评测,成功率62.6%,在公开结果中处于领先位置。

显而易见,Riemann-1.0基本功评测稳居第一梯队,而优势最明显的,恰恰是RoboCasa-365这种强调家庭长流程、跨场景泛化的考试。

真实机器人评测结果

仿真评测只能说明模型具备一定能力,真实机器人上的连续执行才是更直接的考验。

为适配真实落地场景,团队又进行了专项后训练。

他们搭建了四类代表性的家务考场:

  • 有序积木堆叠,考精准操控和指令理解;
  • 柔性布料折叠,考形变物体的交互处理;
  • 桌面杂物整理和厨房餐具收纳,考杂乱居家环境下的长流程连续操作。

示范数据靠人工遥操作采集,四类场景合并做联合训练。

为了公平,参与对比的开源基座模型也拿同样的数据、同样的训练步数做了后训练,站在同一条起跑线上。

结果Riemann-1.0平均成功率85.00%,过程完成度(衡量长流程中间步骤推进的指标)94.43%,两项都在所有对比方法里排名第一,领先最好的开源模型15个百分点。

而且四类任务成功率全部超过80%,每项的过程完成度都在91%以上。

通俗地说:

不光结果能干成,中间每一步也走得稳,长流程不掉链子。

从仿真登顶到真机上岗,Riemann-1.0把「看人类视频学干活」这条路,从头到尾走通了。

黎曼动力与昆仑万维:从数字世界走向物理世界

最后,再回到黎曼动力这家公司本身。

一个值得讨论的问题是:

昆仑万维此前更多出现在AI游戏、AI音乐和AI视频等数字内容领域,为什么现在开始进入机器人赛道,并专门成立子公司独立运营?

这背后可以从行业趋势和公司自身技术路径两条线理解。

行业逻辑:AI开始进入物理世界

为什么具身智能和世界模型成为新的关注方向?

本质上是因为交互方式正在发生变革。

人和AI的交互,前几年靠文字、图片、音视频;接下来,AI要开始伸手碰物理世界了。

因此,数字内容公司进入机器人领域看似跨界,本质上仍然是在延伸AI理解和生成世界的能力。

公司逻辑:世界模型底座向机器人延伸

从昆仑万维自身的产品布局看,这一步也并非完全突然。

早前那些高频的模型更新就不说了,就说这次它主办的《世界模型与多模态范式跃迁》论坛,其实一共亮相了三款模型:

  • Matrix-3.5世界模型(升级):可交互能力实现跃迁,打通数字孪生与具身智能底层底座;
  • Mureka v9.5(升级):AI音乐创作走向量产级落地;
  • 机器人模型Riemann-1.0(首发):打通世界模型与实体机器人交互闭环。

这三款模型放在一起,可以看到一条相对清晰的技术路线:

前两个管数字世界的生成,第三个开始伸手碰真实世界。

尤其是世界模型这块底座,一头连着游戏和视频;另一头,第一次连上了实体机器人。

当数字世界的生成能力逐渐成熟后,将世界模型延伸到实体机器人,成为自然的下一步。

两条线在这里交汇,就有了黎曼动力。

为什么单独成立机器人公司

至于采用独立公司的组织方式,原因也不难理解。

昆仑万维的逻辑并不复杂:

机器人这种硬核赛道没有速胜,得让核心团队独立发展、配上专属资源、做长期投入。

母公司出算力、出生态,团队专心跑技术,各展所长。

一套动作下来,昆仑万维,这家几年前就把「实现AGI」写进公司使命的玩家,第一次真正把手伸进了物理世界。

总结:具身智能正在从“看懂”走向“理解并行动”

语言模型让AI学会在屏幕里理解和生成信息,具身智能则要求AI把这种能力带进真实世界。

Riemann-1.0所代表的世界动作模型路线,核心不是让机器人机械地模仿某个动作,而是让它从大规模视频中学习环境变化、物体交互和任务顺序,再通过真实机器人数据把这些经验转换为可执行的控制信号。

这条路线仍然面临数据质量、推理速度、训练成本和真实环境可靠性等挑战,但它说明了一件重要的事:

机器人正在从“看到指令就做动作”,走向“理解环境、预测结果,再决定怎样行动”。

说明:本文主要用于介绍具身智能、世界模型和人类视频训练机器人的基本思路。文中的模型数据和评测结果根据公开材料整理,具体数字以模型团队及相关评测项目的正式发布为准。

本文为具身智能与世界模型学习笔记

量子位 | 公众号 QbitAI

赞(0) 群聊
文章链接:https://tucaod.xyz/14481.html
资源仅供个人学习交流,请于下载后24小时内删除,不允许用于商业用途,否则法律问题自行承担。

神吐槽 抢沙发

讨论群终身200元

永远不解散,不涨价。不荐股、不带单。
ai学习安装,美股分析交流,不构成任何投资建议。终身免费指导。
AI产业链资料整理+资料库

联系我们

觉得文章有用就可以进群

继续追寻中本聪的脚步

支付宝扫一扫打赏