具身智能为什么需要世界模型?从Riemann-1.0看机器人如何学会干活
具身智能要解决的,不只是让机器人看懂一句指令,而是让它理解:一个动作会怎样改变物理环境,下一刻世界又可能变成什么样。
语言模型可以在屏幕里回答问题,但机器人真正进入家庭和工厂后,还要面对餐具会滑、布料会变形、物体会遮挡、动作可能失败等现实问题。
世界模型负责预测环境如何变化,动作模型负责把这种理解转化为机器人可以执行的控制信号。Riemann-1.0展示的,正是一条把两者结合起来的路线:先从海量人类视频中学习物理规律和操作常识,再用真实机器人数据完成动作对齐。
Riemann-1.0由黎曼动力推出,并在WAIC 2026上正式发布。根据团队公开结果,它在长序列家务评测RoboCasa-365中取得62.6%的成功率,较材料中列出的此前最佳结果提高8.4个百分点。
比跑分更直观的是真机演示。机器人收拾餐桌时,能够夹起贴在桌面的勺子,先倒掉碗里的残留液体,再把餐具收走,最后完成桌面擦拭。
这类任务难的地方,不是单独完成一次抓取,而是连续理解环境、判断动作顺序,并在前一步改变环境后继续执行下一步。
黎曼动力背后是昆仑万维,前者是其面向具身智能方向成立的子公司。
一个刚进入公众视野的模型,为什么能在复杂家务任务上取得这样的成绩?
答案藏在它的训练数据和训练方式里:
23.2万小时训练数据中,占最大比例的并不是机器人数据,而是人类做饭、叠衣服、整理桌子等第一视角视频。
具身智能为什么需要世界动作模型
VLA与世界模型:两条路线正在合流
为什么机器人开始学习人的视频?
这要从具身智能领域长期存在的路线分歧说起。
VLA和世界模型,代表了两种不同的机器人智能路径。
两派各有优劣。
简单总结就是:
VLA属于「直觉派」,快但容易翻车;世界模型属于「深思派」,稳但是又慢又贵。
随着研究深入,越来越多团队发现:
两条路线并不是非此即彼,而是可以互相补充。
于是,VLA与世界模型开始走向融合。
英伟达西雅图机器人实验室在2026年6月发布的相关综述中,给出了一个值得关注的判断:
World Action Model(WAM,世界动作模型)已经从VLA研究里的小众分支,迅速长成了机器人基础模型的第二条主路线,而下一代机器人基础模型,大概率是两者的混合体。
ICML 2026上,包括LeCun团队在内的多篇论文也在往同一个方向推进:
从海量无标注的野外视频(in-the-wild videos)里学习潜在动作世界模型。
把这些工作放在一起看,一条正在被越来越多团队验证的训练范式浮出水面:
先用大规模开放世界视频做预训练,让模型看遍人类怎么和物理世界打交道,攒够物理直觉;再用少量真实机器人数据做动作对齐,把直觉翻译成可执行的控制信号。
为什么机器人开始学习人类视频
对机器人来说,人类的日常生活本身就是一场持续发生的操作示范。
做饭、叠衣服、整理房间等第一视角视频,记录了人类如何观察环境、安排动作顺序、接触物体并处理意外情况。
与昂贵的机器人真机数据相比,这类视频规模更大、场景更多,也更容易持续获得。
一些前沿团队已经开始沿着这条路线探索。
比如Being-H0.7用了20万小时第一视角人类视频,Generalist AI的GEN-1更是砸了50万小时可穿戴设备采集的人类数据。
Riemann-1.0的特点在于:
它尝试把“人类视频预训练—动作轨迹提取—真实机器人对齐”这条路线完整工程化,并同时在仿真和真机任务中进行验证。
而它之所以能跑通,关键在于解决了一个核心难题:
人类视频里没有机器人动作标签。
这也是这条路线最难解决的问题。
人叠衣服的视频看得再多,机器人手臂该转多少度、夹爪该用多大力,视频里一个字都没写。
换句话说,机器人可能看懂人在做什么,却仍然不知道自己的关节和夹爪应该怎样运动。
20万+小时人类干活的视频,怎么变成机器人手上的活儿?
这正是Riemann-1.0故事的起点。
Riemann-1.0如何把人类视频变成机器人能力
核心问题是:23.2万小时视频,怎样一步步变成机器人可以执行的能力?
Riemann-1.0是一款面向通用机器人操作的世界动作模型(World Action Model,WAM)。
从功能上看,它正是前文所说的“混合体”:
它既学习直接生成机器人动作,也学习预测动作发生后环境会怎样变化。
而它要攻克的,正是行业面前那道共同的坎:
怎么把没有动作标签、来源五花八门的开放世界数据,变成机器人可执行的控制能力,而且要跨机器人本体通用。
Riemann-1.0的解法,用做菜来类比,可以拆成三步。
第一步:准备训练数据,也就是“备料”
如果把训练模型比作做菜,数据就是最基础的食材。
Riemann-1.0使用了三类互补的数据:
- 「广菜」:20万+小时人类第一视角视频;
- 「精菜」:1.2万+小时UMI与外骨骼手套数据;
- 「准菜」:2万+小时机器人真机与仿真轨迹。
三种数据来源,23.2万小时训练数据,覆盖41种机器人本体、数千种交互方式。
三类数据合计23.2万小时,既提供开放世界中的场景多样性,也提供可以用于控制学习的精确动作信息。
不过,食材多,不等于能直接开席。
尤其是占大头的那道「广菜」:
20万+小时人类视频,没洗没切,连动作标签都没有,没法直接下锅。
怎么办?下一步就是清洗、切分和标注这些视频。
第二步:清洗和标注人类视频,也就是“备菜”
黎曼动力为此设计了一套自动化人类视频处理流水线。
下面可以沿着一段第一视角视频的处理过程,理解这条流水线在做什么:
一段「人在厨房切菜的第一视角」视频进厂,第一件事是摆正。
鱼眼镜头的畸变、歪了倒了的画面,统统矫正成正视图,方便后面处理。
接着VLM上场,把长视频切成一个个细粒度动作,给每一段配上任务描述、动作指令、场景和物体信息。
切完还得过两轮一致性校验,标得对不上的,推倒重来。
切好的片段紧接着过质检。
画面里人太多的、动作没意义的、遮挡严重的、活儿没干完的、不是第一视角的、手出了画面的,六类废片,直接进垃圾桶。
活下来的片段,迎来整条流水线上最核心的一步:
给手建3D模。
系统检测并追踪画面里的手,重建出完整的手部姿态,再配合相机位姿估计,把手的运动轨迹换算进世界坐标系,最后做整段平滑。
到这一步,视频里「手怎么动」,第一次变成了机器可读的3D坐标。
当然,重建的质量也得把关。
手看不清的、动得太快的、镜头晃太狠的,按阈值再筛一轮,和前面的语义质检互为补充。
最后一步是装盘:
按场景、任务、动作和相关物体等语义维度分类,再重新调整数据比例,避免模型过度偏向少数高频任务。
一段段视频这样走下来,海量「人类干活的录像」,就变成了一本机器人能读懂的「动作教材」。
另外,UMI、外骨骼手套和机器人轨迹通常自带更明确的末端执行器或控制信息,处理方式相对成熟,本文不再展开。
第三步:联合学习视频变化和机器人动作,也就是“炒菜”
数据准备完成后,接下来要解决的是模型架构和训练策略。
在架构上,Riemann-1.0采用扩散式生成框架,将视觉变化、环境状态和机器人动作序列放进同一个过程中联合学习。
这意味着,模型不只是知道「眼前看到了什么」,还在学习:
动作会如何改变环境,以及下一刻世界可能变成什么样。
而为了让同一个模型适配41种不同形态的机器人本体,Riemann-1.0进一步设计了本体专属的动作映射模块:
共享对世界的理解,同时保留不同机器人的「肢体适配能力」。
可以把它理解为一个共享的“世界大脑”:主体模型负责理解环境并预测变化,不同机器人的动作映射模块再把这种理解转化为各自可以执行的控制信号。
模型架构决定“怎么学”,三阶段训练策略则决定“先学什么、后学什么”。
训练分三段,秘诀藏在一组数字里:
动作损失权重0.1→0.5→0.9。
第一阶段:潜动作预训练(小火慢炖)
使用Latent Action Model从海量人类视频中提取伪动作信号,动作损失权重设为0.1,让模型优先学习画面变化和物理世界的运行规律。
第二阶段:真实轨迹对齐(中火调味)
引入UMI、三维手部轨迹和真实机器人动作进行校准,将动作损失权重提高到0.5,使伪动作表示逐步过渡到真实控制空间。
第三阶段:机器人策略强化(大火收汁)
最后只使用高质量机器人数据继续训练,将动作损失权重提高到0.9,重点强化真实机器人执行能力。
从「以理解世界为主」渐进切换到「以执行动作为主」,有点像大模型训练里从预训练到对齐的路径,只不过载体从文本换成了物理世界的动作。
人类视频到底带来了多大提升
现在回到最关键的问题:
使用人类视频预训练,是否真的能提升机器人的操作能力?
公开的消融实验给出了比较直接的结果。
在专门考察长序列家务能力的RoboCasa-365上:
- 模型从头训练,成功率38.2%;
- 加机器人数据预训练,43.4%,涨5.2个百分点;
- 再加UMI数据,48.2%,又涨4.8个百分点。
然后,加入人类视频数据:
62.6%。
相较于加入UMI数据后的48.2%,成功率进一步提高14.4个百分点。
团队对此的解释是:
这说明人类数据带来的远不止「更多训练样本」,它给模型灌进了更丰富的物体交互方式、动作语义和任务先验,直接抬高了模型在没见过的场景里的泛化上限。
另一组控制变量实验也显示了类似趋势。
在专为双灵巧手人形机器人设计的EgoVLA基准测试中,同样的模型、同样的机器人数据,仅仅比较加不加人类视频预训练:
- 长程多阶段任务的成功率从42.96%提升到71.11%,提高约28个百分点;
- 换成完全没见过的视觉背景,也从26.36%提升到43.33%。
这些结果说明,任务链越长、场景越陌生,人类视频中包含的操作先验越有价值。
搞定这个基础性问题,最后来看整体成绩单。
仿真评测结果
模型在三项仿真评测中的公开结果如下:
- LIBERO:业内常用的标准操作评测,考基本功,Riemann-1.0成功率99.0%;
- RoboTwin 2.0:主打双臂协作任务的仿真基准,成功率94.3%;
- RoboCasa-365:面向长流程家务任务的评测,成功率62.6%,在公开结果中处于领先位置。
显而易见,Riemann-1.0基本功评测稳居第一梯队,而优势最明显的,恰恰是RoboCasa-365这种强调家庭长流程、跨场景泛化的考试。
真实机器人评测结果
仿真评测只能说明模型具备一定能力,真实机器人上的连续执行才是更直接的考验。
为适配真实落地场景,团队又进行了专项后训练。
他们搭建了四类代表性的家务考场:
- 有序积木堆叠,考精准操控和指令理解;
- 柔性布料折叠,考形变物体的交互处理;
- 桌面杂物整理和厨房餐具收纳,考杂乱居家环境下的长流程连续操作。
示范数据靠人工遥操作采集,四类场景合并做联合训练。
为了公平,参与对比的开源基座模型也拿同样的数据、同样的训练步数做了后训练,站在同一条起跑线上。
结果Riemann-1.0平均成功率85.00%,过程完成度(衡量长流程中间步骤推进的指标)94.43%,两项都在所有对比方法里排名第一,领先最好的开源模型15个百分点。
而且四类任务成功率全部超过80%,每项的过程完成度都在91%以上。
通俗地说:
不光结果能干成,中间每一步也走得稳,长流程不掉链子。
从仿真登顶到真机上岗,Riemann-1.0把「看人类视频学干活」这条路,从头到尾走通了。
黎曼动力与昆仑万维:从数字世界走向物理世界
最后,再回到黎曼动力这家公司本身。
一个值得讨论的问题是:
昆仑万维此前更多出现在AI游戏、AI音乐和AI视频等数字内容领域,为什么现在开始进入机器人赛道,并专门成立子公司独立运营?
这背后可以从行业趋势和公司自身技术路径两条线理解。
行业逻辑:AI开始进入物理世界
为什么具身智能和世界模型成为新的关注方向?
本质上是因为交互方式正在发生变革。
人和AI的交互,前几年靠文字、图片、音视频;接下来,AI要开始伸手碰物理世界了。
因此,数字内容公司进入机器人领域看似跨界,本质上仍然是在延伸AI理解和生成世界的能力。
公司逻辑:世界模型底座向机器人延伸
从昆仑万维自身的产品布局看,这一步也并非完全突然。
早前那些高频的模型更新就不说了,就说这次它主办的《世界模型与多模态范式跃迁》论坛,其实一共亮相了三款模型:
- Matrix-3.5世界模型(升级):可交互能力实现跃迁,打通数字孪生与具身智能底层底座;
- Mureka v9.5(升级):AI音乐创作走向量产级落地;
- 机器人模型Riemann-1.0(首发):打通世界模型与实体机器人交互闭环。
这三款模型放在一起,可以看到一条相对清晰的技术路线:
前两个管数字世界的生成,第三个开始伸手碰真实世界。
尤其是世界模型这块底座,一头连着游戏和视频;另一头,第一次连上了实体机器人。
当数字世界的生成能力逐渐成熟后,将世界模型延伸到实体机器人,成为自然的下一步。
两条线在这里交汇,就有了黎曼动力。
为什么单独成立机器人公司
至于采用独立公司的组织方式,原因也不难理解。
昆仑万维的逻辑并不复杂:
机器人这种硬核赛道没有速胜,得让核心团队独立发展、配上专属资源、做长期投入。
母公司出算力、出生态,团队专心跑技术,各展所长。
一套动作下来,昆仑万维,这家几年前就把「实现AGI」写进公司使命的玩家,第一次真正把手伸进了物理世界。
总结:具身智能正在从“看懂”走向“理解并行动”
语言模型让AI学会在屏幕里理解和生成信息,具身智能则要求AI把这种能力带进真实世界。
Riemann-1.0所代表的世界动作模型路线,核心不是让机器人机械地模仿某个动作,而是让它从大规模视频中学习环境变化、物体交互和任务顺序,再通过真实机器人数据把这些经验转换为可执行的控制信号。
这条路线仍然面临数据质量、推理速度、训练成本和真实环境可靠性等挑战,但它说明了一件重要的事:
机器人正在从“看到指令就做动作”,走向“理解环境、预测结果,再决定怎样行动”。
说明:本文主要用于介绍具身智能、世界模型和人类视频训练机器人的基本思路。文中的模型数据和评测结果根据公开材料整理,具体数字以模型团队及相关评测项目的正式发布为准。
本文为具身智能与世界模型学习笔记
量子位 | 公众号 QbitAI
















