人形机器人数据瓶颈破解:高级智能机器人配方核心揭秘

频道:行业资讯 日期: 浏览:24

2026年6月3日这一时间, 在ICRA 2026大会的主题演讲环节那里, 德克萨斯大学奥斯汀分校副教授、身为NVIDIA GEAR团队负责人的朱玉可(Yuke Zhu), 发表了有关人形机器人基础模型方面最新的演讲。他做演讲中, 把当前人形机器人所面临的最大瓶颈也就是数据, 进行了系统性地拆解, 并且提出了以“数据金字塔”作为框架、以“世界模型”当做引擎的规模化路径。

于朱玉可而言有这样的指出, 人形机器人此刻正步入一个全新的加速时期, 其中硬件方面正变得日益成熟, 学习算法以及基础模型的规模化也处于快速推进状况。然而, 在这中间真正对这个领域从Demo迈向大规模部署形成制约的, 依旧是数据。真实的机器人数据质量是最高的, 可极为稀缺, 仿真过程中数据能够实现无限生成, 只是存在着仿真到真实这一通路上的鸿沟。

故而, 他给出了一项三层数据金字塔策略, 底层是海量然而被动的互联网人类视频数据, 中层是能够无限生成的合成数据, 顶层是真实的机器人数据。

他的核心观点是, 不应该对单一数据源进行押注, 而要以一种异质的方式, 去汇集三种不同的数据, 与此同时, 要让世界模型去扮演那样一种“数据海绵”的角色, 吸收并且整合所有类型的数据。

在具体实践当中, 朱玉可展现出了两个典型事例, 其一为SONIC, 其利用大规模人类行动捕捉数据去训练人形机器人全身控制器, 借由运动跟踪目标显著简化了强化学习的奖励函数设计, 达成了万小时级别的规模化训练;其二是EgoScale, 它从第一人称视角的人类视频里学习, 凭借“预训练获取人类知识, 对齐训练压缩知识, 后训练表达知识”的三阶段办法, 致使机器人只需不到1%的真实机器人数据便可完成复杂操作任务。

整场演讲里, 最能让人感到振奋的结论出现了, 它源自DreamZero世界动作(World Action Model, 即WAM)模型这一事物: 借助把视频生成模型转变为动作生成器这种方式, 由纯AI生成的虚拟轨迹, 在训练价值方面, 几乎等同于真实物理数据, 等效程度几乎达到100%。

最后朱玉可着重指出, 为促使整个领域向前发展 , 开源以及开放是绝对不能缺少的。NVIDIA已经将GR00T基础模型 、Isaac仿真框架以及相关数据集进行了开源 , 并且刚刚推出了首个H2 Plus参考平台。

下面是朱玉可在ICRA 2026大会所发布的演讲解编稿, 雷峰网依据原来的英文演讲内容做了不改变原意的翻译编辑:

人形机器人正在进入新时代

我今儿要讲的是, 人形机器人以及基础模型 , 率先给出个总结则是 , 我觉得我们正步入人形机器人技术的一个全新时期 , 硬件愈发强大 , 学习算法 , 基础模型的规模化也越发具备可行性。

但我得讲, 最大的挑战, 可能与此同时还是最大的机遇, 依旧在我们眼前摆着呢。

源于“打造自主的、类人的机器人”此种梦想, 人类已着迷达数百年之久。机器人一词最早现身于1920年卡雷尔·恰佩克的戏剧, 该剧名为《罗素姆的万能机器人》。打从起始, 人们便将机器人构想为类人的通用工作者, 而非专为特定用途定制的机器。

我们回顾人形机器人的发展历程, 看到了一波又一波的炒作周期, 先是七八十年代论证技术可行性的概念验证系统, 接着是那些最终没有实现大规模商业成功的愿景原型, 然后是社交伴侣机器人。大约十年前, DARPA机器人挑战赛给我们泼了一盆冷水, 清楚地揭示出即便在人类监督之下, 让机器人进入实际使用是多么困难。直至如今, 没有任何一款人形机器人达成了大规模且快速的部署。

大概在2022年前后, 我们开始目睹一场“人形机器人爆炸”的出现。各大公司, 还有初创企业, 诸如此类的研究机构, 都在制造有着越来越强大功能的机器人。我觉得很大程度上, 这是被AI以及基础模型, 还有大语言模型等方面的进步所驱动导致的。如今, 我会去展示我们最新的研究成果, 我的目标乃是想要让你们看见: 我们存在让心情保持乐观积极的理由, 这是因为进步是十分扎实稳固的。

且与此同时的我, 还得极为坦诚地讲, 至今尚未有人寻觅到那最终极的配方, 而这恰恰就是投身于这个领域的最为适宜的时机。

GR00T架构:系统二 + 系统一 + 全身控制

约摸两年之前, 我很幸运得以在英伟达带领一支人形机器人研究团队。在2024年3月的GTC大会之上, 黄仁勋登台宣告了GR00T项目。这是一项旨在构建人形机器人全栈解决方案的规划。而GR00T - 1是我们所推出的首个开源人形基础模型。

整体架构运用了一种双层的构思设计, 系统二是一个会接收图像以及语言指令当作输入进而生成动作token的视觉语言模型, 一系列这样的token被传递给系统一也就是扩散Transformer, 系统一以此生成闭环动作以供机器人去执行, 整个此种模型呈现出能够进行端到端训练以供机器人去执行的态势且可进行端到端训练。

然而在实际操作当中, 要是你有需要对那种超过四五十个自由度的系统加以控制之时, 一般情况下还得要有一个借助强化学习予以训练的全身控制器, 以此把基础模型所产生的高级指令转化为每个关节的最终执行动作。预训练模型给予机器人泛化能力, 致使其能够依照不同的语言指令, 针对不同物体以及任务目标去执行任务。模型还能够进一步开展后训练, 进而执行更为复杂的操作。

在我们那最新的GR00T进行迭代后的版本N1.7当中, 我们试着去解锁机器人的整个运动学所涵盖的范围, 借助全身运动操作来达成任务。这个模型仅仅是使用了几十个演示开展后训练, 便能够完成复杂的工业流程任务。

大概你们或许有的已然在这几日的海报展览之中不止一回耳闻: 数据, 依旧是规模性增进机器人能力的关键阻碍难点所在, 是核心瓶颈之所在, 是那个关键的限制界限。

数据金字塔:异质数据的规模化策略

大概是在几年之前, 我提出了一个名为“数据金字塔”这样的概念, 这个概念能明明白白地表明我们的数据策略, 我们的数据策略是, 不会单纯依靠单一的数据源去进行扩展, 而是要大规模地去汇集呈异质状况的数据源。

我把数据源组织成三层:

不像仅仅依靠单一类数据源, 我们有着数量众多的研究, 全都专注于怎样去高效运用整个数据金字塔。今日, 我的想法是将要点置于金字塔的最底层部分, 也就是人类数据。

人类数据, 就目前而言, 这般存在让人觉得才属于有着最强可扩展性的数据源头。互联网呢, 它本就是以人作为核心, 那样便把我们这个世界呈现出的态势, 人类所具备的行为举动方式, 每日里要做的平常任务以及日常生活的状况给捕捉了。而人形机器人, 很可能是去消费这类数据最为自然的一种样子, 原因在于两者之间形态方面的差距是比较小的。

人形机器人数据金字塔策略_世界模型引擎规模化路径_高级智能机器人配方

详细来讲, 我们探寻了两类人类数据样式, 一类是人类动作捕捉得到的数据, 另一类是第一人称视角的人类所呈现的视频。

SONIC:用人类动捕训练全身控制器

把人类动作捕捉数据用到一个名为SONIC的工作里, 探索借助它训练通用的人形全身控制器, 此处核心思路为, 先把人类运动重定向到特定人形机器人的形态那儿, 据此生成相对应的动捕数据库, 接着将运动跟踪当作强化学习的训练目标了。

这样的组合将奖励函数的设计极大地进行了简化, 进而使得规模化强化学习训练具备了可能性。在从事大规模事务的时候, 简洁常常会带来更为出色的可扩展性。

我们对模型训练进行了三个维度的扩展, 参数量由120万提升至4200万, 此规模强大, 却又小到能够部署在机器人本体的NVIDIA Jetson上, 数据量达1亿帧, 总计超过10700小时的人类动捕数据, 训练运用了9000个GPU小时, 每个GPU运行自身的物理仿真副本, 合计已然相当于数千年的真实机器人经验。

SONIC的关键之处在于动作的自然流畅特性, 这主要源自运动跟踪目标, 借此让模型更出色地进行人类运动模仿。此模型能够接纳遥操作、基础模型输出, 甚至人类视频当作高级指令。我们已然把它部署于宇树G1机器人之上, 训练代码、部署框架以及数据集均完全处于开源状态。

EgoScale:第一人称视角视频的三阶段训练

我们感兴趣的第二种数据形式,是第一人称视角的人类视频。

观看这类视频, 能为我们提供一个可供进行观察的窗口, 通过利用这样的手段, 我们得以观察人类在日常活动期间所展现出的丰富多样的特性以及复杂的情况。在近期开展的工作EgoScale里头, 我们对人类手腕以及手指于三维空间当中的运动情况进行跟踪, 换而言之, 我们把人想象成为一个机器人, 将头部运动视作动作的空间范围, 利用上述方式, 能够把第一人称视角的视频转化成为用于训练的各类数据。

首先, EgoScale的训练方案存在三个阶段, 其一, 仅于人类视频之上进行预训练部分, 此部分在于从第一人称视角去预测手部运动;其二, 在配对的人机数据里进行对齐表征环节, 借此环节使得知识能够从人类领域迁移至机器人领域;其三, 运用少量真实机器人数据来精调模型。

先来理解一下, 预训练阶段, 它是获取人类知识, 是要从视频里收获常识, 还有物理方面的知识。再看对齐训练阶段, 它是压缩知识, 是从人类领域压缩到机器人领域。而后训练阶段, 它是表达知识, 是利用积累下来的知识去解决具体任务的。

对于这项工作, 令我最为兴奋的是, 模型针对更多的人类视频数据, 具备着极为庞大的需求。当我们把视频数据从1000小时扩充至20000小时的时候, 模型性能呈现出稳健的提升态势, 展现出几近于完美的对数线性关系。这也就意味着, 倘若继续投入数据, 模型性能将会持续不断地得到提升。

那真正的“魔法”源自预训练, 预训练的程度越好, 后续训练所需要的数据量就越少, 这便是我们的规模化方案, 绝大部分的 数据取自人类数据 , 占比不到 1%的数据源自真实机器人。

世界模型即“数据海绵”

在演讲剩下的那段时间当中, 我会去讲述一下“海绵”这类物体的相关故事情况。而我在这里所提及的海绵, 实际上是一种世间的模型。这种世间的模型之所以类似像海绵那般, 是有着其中的缘故的, 即为它拥有着一种十分奇妙神奇的能力, 能够去吸纳摄取数据金字塔里那些不同种类类型的数据内容。

它能够从互联网视频里学习, 借此获取常识以及物理知识、语义知识还有程序性知识, 它能够从合成数据中学习, 从中受益于控制多样性, 它能够从真实机器人轨迹中学习, 以此来精化特定任务的表征, 它能够从多模态数据、音频数据中学习, 或许最为关键的是, 它能够从失败数据中学习, 这类数据对于策略改进而言是极为有用的。

DreamZero:世界动作模型

于DreamZero工作期间, 我们对这个想法展开了探索, 借助世界模型去构建下一代NVIDIA基础模型。其核心为“世界动作模型”, 思索视频生成模型的工作方式: 起始自初始帧, 以一个带有噪声的视频为开端, 一步步进行去噪操作, 进而生成清晰的视频。如此的模型于大规模互联网数据上开展训练, 它能够捕获相当数量的物理理解。随后在机器人数据上予以微调, 告知模型机器人应具备怎样的模样、应当怎样运动。

核心的创新之处在于, 我们不但使模型去生成未来的画面, 而且还增添了一个扩散通道来同步地生成动作。在进行测试的时候, 我们摒弃未来帧的预测,仅仅提取动作的执行。仅仅凭借视频生成模型或者世界模型, 便能够明显地增强视角泛化的能力以及行为克隆的样本效率。

头一遭, 我于公开场合这儿, 把这些结果予以展示。训练GR00T该基础模型的时候, 执行复杂任务, 闭环策略学习及其反应式恢复行为得以展示。倘若你针对机器人研究投入的时间够长久, 那么之于YCB这个数据集中含有的物体, 你是能够认出来的。十年之前, 我瞅见它之际, 认为借助机器人去完成这样的装配任务, 绝对是没有可能的。然而现如今, 有了这基础模型之后, 这已然成为了可能。并且, 还是在一天之内就达成了此事, 任何人工干预都不需要。

对过去两年所获进展, 我感到兴奋, 社区里的加速极为惊人。不过, 很轻松就能看出, 仍有大量工作要做, 我们得有更广泛的研究社区参与。这便是为何我个人极其坚定地看好开源。

不管是于UT Austin的实验室之中, 抑或是我身处英伟达的团队里面, 我们皆竭尽全力去开放开源基础模型, 开放开源仿真框架, 像Isaac这种, 还开放开源数据集以及基准。

恰恰是在这个本周的星期一之时, 我们才刚刚宣告了首个H2 Plus参考性平台。塑造人形机器人的这般梦想始终对我们产生着超过百年长度的极大魅力。然而最终方面, 我能够见到各种各样各不相同形形色色种类范畴广泛的技术要素均在朝着一起之处聚集拢来, 使得我们切实真真切切实实在在有达成实现这个梦想的可能性。我向在座诸位发出邀请, 一块儿共同携手把这份梦想转化成为实际的真实的现实状态存在呀。

Q&A 问答环节

有人询问, 您是怎样促使那些有着基础性特质的模型, 在专门限定的、特定的领域范围之内, 得以达成百分之九十的成功概率, 达成更高级别的、更高的可复现的性质以及可靠性的态势表现?

朱玉可称, 这是个极其不错的问题!要是你曾见过大语言模型展开怎样的训练, 便会明白预训练仅仅是训练初始的那一个阶段。于机器人领域当中, 后训练以及对齐同样起着至关重要的作用。你得针对于特定的任务场景, 运用高质量的领域数据加以精调。与此同时, 可复现性需要有着严格的评估基准以及标准化的测试协议, 就那一点在YCB等基准工作打底的情况上面我们依旧得不停继续推进。大致来讲, 预训练给予你泛化的底座, 后训练给予你领域的深度, 这两者缺少任何一个都不行。