继续追寻中本聪的脚步

具身模型训练触觉!训练触觉数据-隐式触觉世界动作模型@智在无界(BeingBeyond)卢宗青团队

世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型

导读:本文围绕智在无界(BeingBeyond)卢宗青团队发布的 Being-H0.8 展开——这是首个基于人类视频的「隐式触觉世界—动作模型」。它真正反常识的一点是:50 万小时人类视频里几乎都没有同步触觉,而团队却要让模型学会”提前判断接触、并在接触后用触觉重算下一步”。这件事同时压在数据、模型、控制三层:UniHand 3.0 + 通用触觉编码器 + 慢—快动作专家补齐短板,并让触觉同时进入「预测 / 执行 / 调整」三段链路。

这篇文章最值得展开的不是”模型又更强了”,而是”世界模型终于开始碰触觉”这件事究竟卡在哪、为什么之前没人做到、BeingBeyond 又做了哪些工程级妥协。

如果说 Being-H0 到 H0.5 是回答”人类视频到底能不能用”——结论是能用;H0.5 到 H0.7 是回答”怎么规模化地用”——结论是跨本体+隐式世界建模;那 H0.7 到 H0.8 就是回答”怎么高质量地用”——把数据清洗、动作恢复、触觉标注、表示统一做成一条链路,把原始视频转化成机器人能学的物理经验。

真正难啃的不是模型本身,是”触觉从哪来”。没有大规模触觉视频可以用——人类拍视频不戴压力手套,绝大部分机器人数据集也不同步记录触觉。Being-H0.8 选了 TactoHand + 真实压力手套 + 通用编码器这条组合路线,把”无触觉的原始视频”硬改造成”可训练的触觉数据”。

团队信号比论文重要。BeingBeyond 2025 年 5 月才成立,创始人卢宗青是北大长聘副教授、智源学者,本身就是最早探索”用人类视频训练具身模型”的学者之一。一年半时间,靠这条数据路线把数据规模从数千小时推到 50 万小时,模型版本推到 H0.8。

落点:隐式触觉世界—动作模型是不是通往精细操作 AGI 的必要条件?现在下定论太早,但 Being-H0.8 至少把”为什么世界模型缺触觉”这件事,从开放问题推进到了一个具体可推进的方向。

Being-H0.8 预测-执行-反馈闭环:当前画面→MoT 预测接触→慢-快动作专家→机器人执行→读取触觉→反馈回灌预测
根据原文”模型先根据当前画面,预判接下来可能发生的接触,执行过程中再读取最新触觉,重新生成下一小段动作”整理。

为什么世界模型一直缺触觉这块拼图

要说 Being-H0.8 这次最值得关注的亮点,当属创新的隐式触觉世界—动作模型架构和超 50 万小时的超大数据集,咱们先来看模型层面。

对于具身模型而言,触觉不仅关系到精细操作,还能帮它完成仅凭视觉难以实现的接触推断。因此,过去两年,围绕触觉如何赋能具身基础模型,学界已经涌现出不少探索,李飞飞、徐丹飞、Wenzhen Yuan、宋舒然等研究者也都在推进相关方向。

但如果我们把问题进一步聚焦到世界模型,就会发现:触觉究竟该如何进入世界模型,仍然是一个开放问题。

△ 一方面,现有的世界模型大多以视觉为核心。它们可以看到物体如何移动、形变,却很难准确判断接触是否发生、接触发生在哪里,以及物体正在承受怎样的作用力。

△ 另一方面,触觉传感器虽种类繁多,但数据形态和表征方式并不统一。更现实的问题是,绝大多数大规模人类视频和机器人数据集,本身就没有同步记录触觉信息。

这就意味着,想要训练一个具备触觉能力的世界模型,不仅缺少统一的触觉表征,也缺少能够规模化获取的训练数据。Being-H0.8 正是智在无界针对这一问题给出的解法。

拆解:视觉和触觉在世界模型里的角色差异

观察点 视觉为主的现有世界模型 触觉缺失的代价 Being-H0.8 的补法
接触判断 靠画面遮挡/形变推断 滑动、压陷、剪切力几乎看不出来 由通用触觉编码器读出接触 token
接触位置 难以精准定位 视角重叠误报、关节遮挡 TactoHand 在 778 顶点预测接触/邻近度
接触前后状态 只能预测画面变化 无法判断”碰没碰、贴多紧” 预测 token 调节慢-快动作专家
训练数据 人类视频天然丰富 几乎都不带同步触觉 用 TactoHand 从普通视频反推 + 真实手套补

Being-H0.8 的模型架构如何”提前看见接触”

Being-H0.8 在 Being-H0.7 隐式世界—动作模型的基础上,首次把触觉模态纳入隐空间表示中,将原本以视觉预测为主的建模方式,进一步扩展为隐式触觉世界—动作模型(Latent Tactile World-Action Model),把触觉预训练扩展到可规模化的第一视角人类视频数据。

这里的关键在于,Being-H0.8 并不试图在像素层面完整重建未来画面,而是在隐空间中预测与任务真正相关的交互后果——例如是否发生接触、接触可能带来怎样的状态变化,并利用预测出的潜在状态进一步调节动作生成。

换句话说,Being-H0.8 试图让机器人不只”看到”接下来会发生什么,还能从没有显式触觉标注的人类视频中,学习对接触与受力结果的隐式判断。

具体的,Being-H0.8 由四个核心模块组成:负责预测交互后果的 Mixture of Transformers (MoT)、负责执行与实时调整的 慢—快动作专家、负责统一触觉输入的 通用触觉编码器,以及负责统一动作空间的 TopoHand

Being-H0.8 完整架构:Pre-training + Post-training + 慢快动作专家 + 触觉编码器 + TopoHand
根据原文”模型先根据当前画面,预判接下来可能发生的接触,执行过程中再读取最新触觉,重新生成下一小段动作”以及四个核心模块描述整理;对应 BeingBeyond 官方架构图。

其中,通用触觉编码器首先将不同传感器采集到的触觉信号,转换为统一的触觉 token,从而降低不同设备、不同数据形态之间的差异。

而慢—快动作专家,则负责兼顾推理效率与接触反馈:

△ 慢速流缓存视觉、语言和隐世界状态等计算成本更高的上下文,负责维持整体任务与动作计划;

△ 快速流则在动作执行过程中,读取最新状态和触觉反馈,只重新生成接下来的一小段动作。

这样一来,机器人不必每次接收到触觉变化都重新计算完整计划,也能根据滑动、受力变化或接触偏移及时调整动作。

在训练阶段,未来时刻的触觉 token 会进入 MoT 的后验分支,帮助模型理解真实接触发生后,世界状态会如何变化。

到了部署阶段,MoT 负责提前预测交互后果,慢速流维持整体上下文,快速流则根据最新触觉实时纠偏。

由此,触觉不再只是动作完成后的附加反馈,而是同时进入了机器人的”预测、执行与调整”过程。

拆解:Being-H0.8 四个核心模块各自干什么

模块 负责的事 关键输入 关键输出 起的作用
MoT (Mixture of Transformers) 在隐空间预测交互后果 当前画面、指令、隐世界状态 潜在状态 token,调节动作 代替像素级重建,避免昂贵+不稳定
慢—快动作专家 慢流维持计划、快流重算下一小段 共享上下文、最新触觉、最新状态 动作块 (Action Chunk) + 快流补丁 兼顾推理效率与触觉反馈
通用触觉编码器 把不同传感器的触觉变统一 token 位置/接触/邻近度/压力/ID 固定数量触觉 token 解决触觉数据形态不统一
TopoHand 统一人手/灵巧手/夹爪动作空间 Rest Pose + 手腕位姿/形态/关节角 6D+20D+1D+10D 表示 跨本体动作可对齐训练
通用触觉编码器:粗到细的触觉金字塔 + MLP + Query-based Perceiver 输出触觉特征
通用触觉编码器的内部结构:从 Global/Fingertips/Palm Patches/Vertex-level 的金字塔出发,按 N=1…778 不同粒度随机抽取 token,经 MLP 融合为统一触觉特征。

50 万小时人类视频,怎么从”不能用”变成”能用”

聊完模型,一个很自然的问题是:那训练模型的数据从哪里来呢?这就要进入 Being-H0.8 的另一项关键工作——数据。

作为国内最早一批利用大规模人类视频预训练具身基础模型的企业之一,智在无界一直沿着人类视频预训练这条路线持续积累数据,并将其用于具身基础模型训练。Being-H0.8 的数据底座,正是这条路线长期积累的结果。

历经 Being-H0 到 Being-H0.8 的持续迭代,智在无界已汇聚了超过 500,000 小时的第一人称视频数据,并与数十家数据供应商开展合作。这些视频数据覆盖自然物体交互、长时程任务、丰富手部动作与多样场景,为具身模型提供大规模人类交互经验。据智在无界团队介绍,这也是目前国内规模最大的人类操作视频数据池。

UniHand 3.0 数据分布:50万+ 小时人类第一人称视频,多数据源
UniHand 3.0 数据池构成:扇区角度=原始时长占比、内圈面积=实际保留数据占比,按 All data / Open-source / Partner / Self-built 过滤;50 万小时人类视频按场景/任务/视角/动作分布再平衡。

但 50 万小时原始视频,并不等于 50 万小时可以直接用于训练的数据。这些视频中混有大量看不到手、缺少有效操作、镜头剧烈抖动、与桌面物体交互无关或内容高度重复的片段;不同数据源在场景、任务、视角和动作分布上,也存在明显差异。

为此,团队搭建了一套面向数十万小时视频的数据处理管线,对原始数据进行过滤、去重、切分、语言标注和分布再平衡。

首先,团队会剔除无效片段,并将长视频切分为连续的短片段,再为其补充细粒度语言描述。

不过,只有画面和文字还不够。具身模型不仅要知道画面中发生了什么,还要知道人的手处于什么状态、执行了怎样的动作。

对于缺少准确动作标注的人类视频,团队使用 MANO 统一表示手部状态,通过 HMR(hand motion refinement,HMR)恢复和细化裸手运动轨迹,再利用 Caliball 补齐缺失的相机参数,从视频中进一步恢复出可用于学习的手部动作信息。

对于机器人数据,团队重新整理了规范化 URDF,并统一关节约定、相机坐标系和手腕位姿表示,再针对各个数据集完成校准、同步和验证。

此外,团队还会逐项检查数据完整性、运动学一致性、跨模态同步情况,以及语言描述与视频内容是否匹配。

经过过滤、重建和标准化后,来自不同来源的人类视频与机器人轨迹,才被整理为相对统一的数据格式,最终形成 UniHand3.0 训练数据。

Being-H0.8 数据处理管线:Real-world/Simulation + 平台级本体建模 + 数据集对齐 + 过滤增强
Being-H0.8 的 UniHand 3.0 处理管线:Real-world/Simulation 机器人数据 → 平台级本体建模(Canonical URDF+Frame) → 数据集级对齐(Intrinsic Estimation、Frame Alignment) → 过滤与增强(Data Integrity、Geometric Consistency、Data Augmentation)。

拆解:50 万小时原始视频要过几道关才进得了训练

处理环节 输入 做了什么 输出 失败代价
无效片段剔除 50 万小时原始 去掉无手/镜头抖/场景无关 片段通过率尚不公开 再训练噪声放大
切分 + 语言描述 通过的无用片段 长→短,细粒度文本 短片段 + caption 图文错位会污染指令
动作恢复 (MANO/HMR/Caliball) 人类视频 恢复裸手运动 + 补齐相机参数 标准化手部动作轨迹 没了手部状态 → 模型看不见动作
URDF 重整 (机器人数据) 多源机器人轨迹 统一关节约定、坐标系、手腕位姿 规范化机器人数据 错位会导致跨本体学习崩溃
一致性 + 同步校验 所有人机混合数据 完整性/运动学/跨模态同步校验 UniHand 3.0 训练数据 漏检会让”接触预测”被学会假

没有触觉的视频,是怎么被改造成可训练触觉数据的

经过前面的清洗、重建和标准化,模型虽然获得了大规模操作数据,却依然无法直接知道:接触发生在哪里、力度如何变化,以及物体在接触后产生了怎样的反馈。Being-H0.8 接下来的工作,就是把这些原本没有触觉记录的视频,转化为可以参与模型训练的触觉数据。

整套 pipeline 可以分成四步:

△ 第一步,利用 TactoHand 从普通人类视频中恢复接触位置和邻近关系。

△ 第二步,引入压力手套等真实传感器数据,为视觉推断补充物理压力信息。

△ 第三步,通过通用触觉编码器,将不同来源、不同粒度的触觉信号统一成固定格式的触觉 token。

△ 第四步,利用 TopoHand 对齐人手、灵巧手和平行夹爪的结构与动作空间。

沿着这条路径,没有显式触觉记录的人类视频,最终被转换成能够进入世界模型的统一触觉与动作表征。

第一步:从视频中恢复接触

Being-H0.8 首先提出了 TactoHand,用于从无触觉标注的人类视频中预测稠密的伪触觉监督,从而解决大规模人类视频普遍缺少触觉信号的问题。TactoHand 的核心思路是,不要求每段人类视频都同步采集真实触觉,而是先利用手与物体之间的三维几何关系,推断接触是否发生。

在带有三维标注的数据中,系统可以获得已经配准的手部网格和物体网格。通过计算手部顶点与物体表面的距离,并结合二者表面方向,TactoHand 可以判断手部不同位置是否与物体发生接触。在此基础上,TactoHand 会在 MANO 手部表面的 778 个顶点上预测两类信息:一类是接触标注,判断哪里已经碰到物体;另一类是邻近度标注,描述手指从靠近物体到真正接触的连续过程。

这套模型使用 21 个人—物交互数据源、共计 3010 万帧数据进行训练,并引入时序信息辅助判断——毕竟,单张画面中看似贴在一起的手和物体,也可能只是视角重叠;结合连续动作,才能更准确地判断接触是否真的发生。训练完成后,TactoHand 便可以应用到普通第一视角视频:UniHand 3.0 会先重建并跟踪视频中的手部运动,再将预测出的接触和邻近度信息映射回统一的 MANO 拓扑。对于重建结果不可靠的位置,系统会将其标记为无效,而不是直接判断为”没有接触”。

TactoHand 在普通视频中恢复接触标注 vs 邻近度标注的对比示意
TactoHand 在两段不同视角视频上的输出对比:左列为 contact 接触标注、右列为 proximity 邻近度标注;强调”看似贴上”≠”真的接触”,需结合连续动作判断。

第二步:用真实传感器补充压力

不过,从视觉中推断接触,终究不能完全替代真实触觉传感器。几何关系可以帮助模型恢复接触位置和邻近程度,却很难完整获得压力、摩擦、剪切力、滑移和材质等更细致的物理信息。因此,UniHand 3.0 还加入了约 55 小时、540 万同步帧的压力手套数据,并将真实压力信号投影到同一套 MANO 手部表面。两类数据由此形成互补:大规模人类视频负责覆盖更多物体、场景和动作,真实触觉传感器则负责提供更加准确的物理压力信息。

第三步:统一不同触觉数据

但触觉数据有了,格式仍然是乱的。有些数据只标记是否发生接触,有些来自少数几个指尖传感器,有些提供逐顶点的邻近度或压力信息,还有大量样本完全缺失某一类触觉通道。为此,Being-H0.8 设计了通用触觉编码器(Universal Tactile Encoder),在统一手部拓扑上建立了一套由粗到细的触觉金字塔。从整只手是否发生接触,到具体手部区域、指尖,再到逐顶点的压力或邻近度,不同来源的数据都可以被映射到对应的空间粒度。每个触觉 token 除了记录接触、邻近度或压力,还会携带三维位置、拓扑位置、左右手信息和有效性标记——其中,有效性标记尤其重要,因为”没有压力传感器”和”压力读数为零”显然不是一回事。最后,模型通过 Perceiver 结构,将长度不同、密度不同的触觉输入,压缩成固定数量的触觉 token。

第四步:对齐人手与机器人动作

触觉表示统一之后,还要跨过人手与机器人之间的动作鸿沟。人手、灵巧手和平行夹爪在几何结构、自由度和控制空间上都存在明显差异。同一个”捏住””抓取”或”松开”动作,在不同本体上可能对应完全不同的表示方式。为此,Being-H0.8 设计了 TopoHand,将手部表示拆分为手腕位姿、形态编码、20 个规范关节角和夹爪张开量,让语义相近的动作进入相同的表示槽位。它并没有把所有手改造成同一种结构,而是让人手、灵巧手和夹爪开始使用一套可以相互对齐的动作语言。

TopoHand 统一动作空间:手腕位姿+关节角+夹爪状态+形状向量,Skeleton Shape VAE
TopoHand 统一动作空间:人手 Rest Pose + MLP Encoder 输出 6D 腕位姿、20D 关节角、1D 夹爪状态、10D 形状向量;Skeleton Shape VAE 用重建损失 + KL + 潜在一致性做训练。

至此,从普通视频中恢复的隐式触觉、真实传感器采集的压力信号,以及不同本体的动作数据,才真正被统一到同一套表示体系中。

这套 data pipeline 解决的是触觉”从哪里来、如何统一”的问题:TactoHand 负责从大规模视频中补出接触监督,真实传感器提供更准确的压力信息,通用触觉编码器将不同信号转化为统一的触觉 token,TopoHand 则进一步对齐人手与机器人动作。

完成这些准备后,触觉才真正进入 Being-H0.8 的”预测—执行—反馈”链路:训练时帮助 Being-H0.8 学习接触会带来怎样的状态变化,部署时则作为实时反馈,持续修正机器人接下来的动作。

拆解:把无触觉视频变成可训练触觉数据的四步

步骤 输入 所用模块 输出 关键依赖
① 从视频中恢复接触 普通第一视角人类视频 TactoHand (基于 21 个源、3010 万帧训练) MANO 778 顶点上的接触/邻近度 手物三维网格配准 + 时序信息
② 用真实传感器补充压力 压力手套数据 (55 小时/540 万帧) 投影到 MANO 手部表面 逐顶点压力 物理压力 vs 几何接触 互补
③ 统一不同触觉数据 不同来源/粒度的触觉 通用触觉编码器 + 触觉金字塔 + Perceiver 固定长度触觉 token 区分”无传感器”与”读数=0″
④ 对齐人手与机器人动作 人手/灵巧手/夹爪动作 TopoHand (6D+20D+1D+10D) 可对齐动作表征 语义相近动作同槽位,不改造结构

从 Being-H0 到 H0.8,BeingBeyond 走了一条什么样的数据路线

最后,让我们简单介绍一下 Being-H 系列背后的团队——BeingBeyond(智在无界)

BeingBeyond 成立于 2025 年 5 月。创始人 卢宗青 是北京大学计算机学院长聘副教授、智源学者,长期从事强化学习和多模态模型研究。在学术界,他最早开始探索利用大规模人类视频训练具身模型,这也成为 BeingBeyond 此后技术路线的起点。

回看 Being-H 系列的发展,这条路线大致经历了三个阶段。

第一阶段解决的是”人类视频怎么用”。从 Being-H0 到 Being-H0.5,团队首先验证了利用人类视频预训练具身模型的可行性,让机器人能够从人类操作中学习可迁移的动作经验。

第二阶段关注的是”怎么规模化地用”。从 Being-H0.5 到 Being-H0.7,团队不断扩大数据规模,并进一步解决跨本体学习和隐式世界建模问题,让海量、异构的人类视频能够真正参与具身模型训练。

到了 Being-H0.8,问题则进入第三阶段:人类视频怎么高质量地用。重点不再只是继续增加数据量,而是通过清洗、动作恢复、触觉标注和表征统一,从海量原始视频中提取更准确、更具物理意义的训练信号,以高质量数据推动模型能力进化。

因此,Being-H0.8 补上的不只是一个具备触觉能力的世界模型,更标志着 Being-H 系列的数据路线完成了一次转向:从验证人类视频能不能用,到解决海量视频如何规模化使用,再到进一步追问,能从这些视频中提取出多少真正有价值的物理经验。

对 BeingBeyond 而言,核心壁垒也不再只是拥有多少视频,而是能否把数据收集、清洗、动作恢复、触觉标注、世界建模与机器人控制接成一条完整链路,持续将原始视频转化为机器人可以学习和复用的物理经验。

智在无界 Being-H 系列模型迭代路线:从 Being-H0 到 H0.5/H0.7/H0.8,50万小时人类视频规模
Being-H 系列迭代路线:H0(数千小时)→ H0.5(数万小时,展现跨本体和零样本泛化)→ H0.7(20 万小时,首个隐式世界动作模型)→ H0.8(50 万小时,首个隐式触觉世界动作模型)。

拆解:Being-H 系列三个阶段的核心问题与模型迭代

阶段 核心问题 数据规模 模型突破 留下的问题
第一阶段 (H0 → H0.5) 人类视频怎么用 数千 → 数万小时 验证人类视频预训练具身模型的可行性 数据量小、跨本体能力弱
第二阶段 (H0.5 → H0.7) 怎么规模化地用 数万 → 20 万小时 跨本体 + 隐式世界建模 (H0.7) 视觉为主、缺触觉、无统一表征
第三阶段 (H0.7 → H0.8) 怎么高质量地用 20 万 → 50 万小时 隐式触觉世界—动作模型 (H0.8) 物理交互可靠性、长时序任务、跨本体泛化

十、结论边界

判断事项 目前可以得出的结论 目前不能直接得出的结论
触觉是否首次进入世界模型 Being-H0.8 是首个把触觉同时塞进预测/执行/调整三段的隐式世界-动作模型 (原文称) 这一路线能否成为”具身 + 触觉”的标准范式,仍未可知
数据规模 50 万小时 UniHand 3.0 是目前国内最大的人类操作视频池 (团队介绍) 未披露具体有效保留时长、各数据源占比、跨源对齐损失
TactoHand 推断接触 可以在 778 个 MANO 顶点预测接触/邻近度(原文称) 在手物严重遮挡、视频抖动下的精度,复现依赖未公开细节
真实手套数据补充压力 约 55 小时 / 540 万帧压力手套,能把物理压力补到 MANO 表面 与 TactoHand 输出在同一时空下融合的误差,未公开
慢—快动作专家 慢流维持计划、快流在触觉变化时只重算下一小段动作 (原文称) 在不同任务上快流响应延迟、抖动控制等指标未披露
TopoHand 跨本体动作 将人手、灵巧手、夹爪表示拆分到 6D+20D+1D+10D,语义相近动作同槽位 跨本体迁移的实际收益、对末端执行器敏感任务的具体增益未公布
团队与时间表 BeingBeyond 2025 年 5 月成立,1.5 年推出 H0、H0.5、H0.7、H0.8 四代 未披露训练算力、参与合作方、商业化路径
通用触觉编码器 把不同来源触觉变成固定 token,并区分”无传感器”与”读数=0″ 对极端接触(高剪切、超滑移)的有效性,未公开

十一、神吐槽总结

  • 世界模型”看不见接触”,不是模型不够大,是缺一门感官。视觉能把”看着要碰到”和”真的碰了”混成同一像素;触觉进来,最直接的工作是把这俩拆开,别再让机器人”假装摸到了”。
  • 50 万小时人类视频真正缺的,不是时长,是触觉标注。多少人看了两年视频都没意识到:人类拍视频不戴压力手套,这条路线天然缺一块。Being-H0.8 的”硬核”在于没等传感器普及,先用 TactoHand 反推上来。
  • 慢流负责”我打算摸你”,快流负责”刚才是真摸了”。这套双速架构把”决策”和”反馈”在不同时间尺度上同时跑,让模型既能全程规划,又不会被一秒一次的接触变化打断计划——是工程化妥协,不是理论美感。
  • “无压力传感器” vs “读数为零”是两件事。通用触觉编码器给每个 token 打了一个有效性标记,等于明确告诉模型”这里我没数”,避免了”全都是 0 触觉 = 表面十分光滑”的幻觉。
  • TopoHand 不是把人改造成夹爪,是让夹爪学会”像人一样”捏。同一语义动作进同一个表示槽位,比硬把人手结构改造成机械手要稳得多,也更接近人类示范的本质。
  • BeingBeyond 一年半推四代,听着多,但每一代只回答一个问题。H0 答”视频能不能用”、H0.5 答”跨本体”、H0.7 答”隐式世界模型”、H0.8 答”触觉从哪来”。这种节奏比”模型每年涨 X%”更接近做对事的状态。
  • 数据路线的真正壁垒,不在谁有更多视频,在于谁能”清洗 + 恢复 + 触觉化 + 表征统一”做成一条产线。原始视频到处都是,能稳定输出机器人可学样本的产线,是另一个物种。
  • 具身模型的”亚里士多德时刻”还没到,但开始有清晰的分支。语言模型靠 token + 上下文就能赢得大众目光;具身模型必须把”看 / 听 / 触 / 控”接成一条链——H0.8 至少把”触”这条接上了,下一步是接”听”还是接”协同”,还没人敢下定论。

一句话总结:这篇最有力量的地方,是把”世界模型为什么缺触觉”从一个开放问题,推进到了一条可复现的数据 + 模型 + 控制三段工程链路;最需要继续验证的地方,是 TactoHand 推断接触、TopoHand 跨本体和真实压力手套三者融合后的物理可靠性,能否撑得起长时序、跨本体、接触多变的真实任务。

参考资料
  • 世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型 – 量子位 QbitAI
  • BeingBeyond 智在无界(公众号)
  • 量子位 QbitAI(公众号)

  1. 世界模型有触觉了?50万小时视频,训出首个隐式触觉模型
  2. 为什么世界模型一直”看不见”接触?智在无界押注这条冷门路线
  3. 触觉数据从哪来?30万人-物交互+540万帧,让机器人学会”摸”出接触
  4. 机器人包薯片都费劲?Being-H0.8 把触觉塞进预测闭环
  5. Being-H0.8 内部长什么样?四模块 + 一条反馈回路,第一次说清触觉预测
  6. 具身模型下一站在哪?智在无界给了一份”隐式触觉世界-动作”路线图
  7. 触觉传感器五花八门怎么统一?Being-H0.8 给出了一个通用编码器
  8. 50万小时人类视频怎么用?BeingBeyond 用 TactoHand 把”无触觉”变可训练
  9. 一年半推四代,智在无界如何把触觉塞进世界模型?
  10. 慢流决策、快流重算:Being-H0.8 用双速动作专家解决了什么?

  1. 50万小时人类视频、30万人-物交互帧、540万帧压力手套——Being-H0.8 把触觉首次塞进隐式世界-动作模型的预测-执行-反馈闭环
  2. 一条管线、两个新模块、三个老问题:Being-H0.8 用 TactoHand + 通用触觉编码器回答了”人类视频怎么高质量用”
  3. 视觉预测擅长”看形状”,触觉预测擅长”摸接触”。Being-H0.8 在隐空间里把两者首次打通,让机器人包薯片不再翻车
  4. 1 个核心创新、4 个核心模块、5 段链路打通:触觉不再是动作后的附加反馈,同时进入预测/执行/调整
  5. 50万小时原始视频,过滤管线要过五关:去重、切分、MANO/HMR、URDF 统一、跨模态同步,任何一关漏都会污染接触预测
  6. 21个数据源、3010万帧训练、778个顶点判断——TactoHand 用最少标注教会模型判断”碰没碰、贴多紧”
  7. 世界模型 + 触觉 = 隐式世界动作模型:Being-H0.8 把”摸”这件事写进预测,不留到事后补
  8. 1 套数据、3 个阶段、1.5 年时间:BeingBeyond 用 TactoHand + 压力手套 + 通用编码器把数据路线推到 50 万小时
  9. 接触不需要等到接触发生:MoT 预测接触,慢流维持计划,快流读取触觉重算——一个在预测阶段就先”看见”接触的世界模型
  10. 人类视频天然不带触觉,是世界模型最大短板。Being-H0.8 用 TactoHand 推断接触 + 真实压力手套补物理,把这条短板补上
赞(0) 群聊
文章链接:https://tucaod.xyz/15197.html
资源仅供个人学习交流,请于下载后24小时内删除,不允许用于商业用途,否则法律问题自行承担。

神吐槽 抢沙发

讨论群终身200元

永远不解散,不涨价。不荐股、不带单。
ai学习安装,美股分析交流,不构成任何投资建议。终身免费指导。
AI产业链资料整理+资料库

联系我们

觉得文章有用就可以进群

继续追寻中本聪的脚步

支付宝扫一扫打赏