智能机器人3d模型生成:一张照片秒变真实物理属性3D资产

频道:行业资讯 日期: 浏览:22

首个支持物理仿真的三维生成模型来了!

仅凭借一张平平无奇的照片, AI便能够直接生成3D数字模型, 还能预测诸如重量、软硬以及关节活动等真实存在的物理属性, 这意味着, AI所生成的不再仅仅是与照片描述模样相像的资产, 而是切实能够与物理世界展开交互, 并且有希望对具身智能、物理AI、AI for Science的模型直接展开训练。

近期, 刘子纬副教授所在的新加坡南洋理工大学团队, 开发出了统一的三维生成框架PhysX-Omni, 此框架打通了刚体、可变形体、关节体(铰链体)这三类资产的物理级3D生成。他们发明了一种编码办法, 叫模板化游程编码, 这个编码不仅能直接使语言模型读懂三维结构, 还会让生成性能显著提升。

刘子纬向DeepTech表明, 以往3D模型生成得开展实际扫描与采集, 然而鉴于价格高昂且无法实现规模化, 所以并不契合大模型的可扩展性。并且, PhysX - Omni开启了近乎没有穷尽的生产模式, 这等同于去做数据基建, 它持续为物理AI生产供给训练素材。

PhysX - Omni能生成详细且通用的3D资源, 这些资源涵盖刚体、可变形物体以及关节体, 还能生成适用于下游应用的仿真就绪物理资产,来源是arXiv。

PhysX - Omni的模型仅有7B, 即Qwen2.5 - VL - 7B - Instruct , 其总体推理成本很低, 据研究人员预估, 该模型成本在传统仿真软件成本的十分之一到二十分之一之间, 更值得关注的是, 该模型的绝对尺度预测误差从约300降到了2.79 , 整整提升了两个数量级, 这意味着, 由AI生成的椅子不再是那种模糊表述的“大约这么高”, 而是精准明确说明高度的“就是65厘米高”。

PhysX - Omni在仿真就绪场景生成里表现出应用潜力, 此场景有机器人策略学习等情况, 其应用潜力还体现在具身智能领域, 也体现在物理仿真领域, 还体现在游戏领域, 也体现在影视等领域。相关论文题目是“PhysX - Omni: Unified Simulation - Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects”, 该论文发表在了预印本网站arXiv。

让 AI 学会物理常识:从“看得美”到“能交互”

要是我们打算借助AI去创造一个箱子, 多数模型不清楚该用多大的力量去推搡它, 在存在风吹的情形下它是否会倒伏 , 或者会移动多少长短的距离。当下有着3D模型生成好似“真空中的球形鸡”这般的状况, 即便整体呈现得较为美观, 然而与外界不存在任何的交互 , 常常会出现穿模 , 漂浮 , 关节胡乱转动等方面的问题。

往昔的三维范畴中, 刚体被单独研究, 可变形体被单独研究, 关节体也被单独研究。研究团队发觉, 这三个子领域根本上讲或许是同一个问题, 所以除数字世界能用同一套代码外, 物理世界背后的结构实际上也有可能凭借一套代码来予以表示。

此研究等同于给AI赋予了物理常识, 把3D模型生成从单纯生成得美观, 转变成可以实现交互并且好用, 不但能够推动跨类型学习, 还削减了开发成本与门槛。

拿机器人折叠衣物当作实例, 衣物属于那种能够变形的事物, 将它折叠完备后放置进箱子里时, 它是一种刚体;随后把衣柜 door 打开着, 衣柜在此情形下成为关节体。在晓得怎样去折叠衣物这件事情之后, 或许这种认知反过来能够对完成一些别的任务做出些许帮助。

面对一张完整的或者是部分被遮挡的图像, PhysX - Omni先是推导出高层次的整体信息, 接着运用多轮生成流程来生成详细的部件级几何结构。鉴于全局表示和局部表示之间具备固有的关联, 这些输出结果能够直接被整合成为可用于仿真的物理三维资源(源自: arXiv)。

理查德·萨顿, 这位被称作强化学习之父的人,在一篇名为《苦涩的教训》的经典文章里提到, 只要数据量达到足够多的程度, 中间产物有可能会自然而然地涌现出来, 所以只需要确定好最终目标就行。刘子纬表示, “我们最原初的设计哲学也受到了这种观点的启发, 期望尽可能地去实现端到端的学习。”。

以往的研究存在两种情况, 一种是进行压缩结果把细节给弄丢了, 另一种是运用分割模块从而引入了错误。而PhysX - Omni采用了全新的几何表达方式, 这种方式是把每个部件的三维网格沿着Z轴切成一层一层的二维掩膜, 之后基于经典的游程编码, 再把每个切片压缩成文本串。

既保留了高分辨率的结构信息, 又绕过了中间表征进行直接建模, 其模板RLE表示从而减少了误差累积, 新编码方式最直观的变化表现在两方面, 一是高度保持3D细节, 二是高效, 即编码同样的信息, 可比之前工作再少1/4到1/5的tokens。

PhysXVerse 的统计与分布(来源:arXiv)

研究人员构建了首个通用仿真就绪 3D 数据集 PhysXVerse 来训练该框架, 它是从 PartVerse 的精细标注里筛选过滤而来的, 保留了超过 8,700 个高质量资产, 覆盖 2,900 多个室内外类别, 这些类别包括直升机、坦克、赛车、摩天大楼以及玩具等, 部件数量从单个刚体一直延伸至有 65 个零件的复杂铰接系统。

每一个资产, 在具备几何网格的情形以外, 还借助人工校验这种方式, 把绝对尺寸、材质类型、功能语义、关节类型以及运动范围等物理标注进行补齐。

误差骤降 100 倍,一张照片生成仿真级 3D 资产

智能机器人3d模型_基于照片的物理属性预测_AI物理仿真3D模型生成

然而, 仅仅具备数据以及模型是不足够的, 为了能够在开放环境里更加全面且灵活地评估生成与理解能力, 研究团队还打造了评测基准 PhysX-Bench, 它覆盖了六个关键属性维度, 分别是几何、绝对尺度、材料、可供性(物体能够被怎样操作)、运动学以及描述。

这一套评测所具备的巧妙之处在于, 它并不是依靠价格高昂的真实标注, 而是运用仿真去加以测量物理方面, 这样做不但规避了人工标注所产生的主观性, 而且还能够更加真实地展现出资产在实际进行部署时的表现。

显示 PhysXVerse 数据集结果, PhysX - Omni 的 PSNR 是 21.52, Chamfer Distance 降低到 2.95, F - score 达到 91.28, 几何精度全面超过此前最优方法。更值得留意的是绝对尺度误差: 从 PhysXGen 的 309.31 急剧下降到 2.79, 几乎提高了两个数量级。

出乎我们意料的是, 刘子纬表示, PhysX - Omni在绝对尺度误差方面的表现。这和研究团队的两个观察紧密相关。其一, 许多此前的数据, 被研究人员发现天然带有幻觉, 于是, 他们对数据进行了重新编排以及清洗。其二, 借助新的编码方式, 它对绝对尺度的分辨率大幅提高, 从而, 能更精准地理解真实世界里物体的尺寸。

(a)于三维建模里头, 不同几何呈现方式加以对照比较;(b)PhysX - Omni的详尽几何呈现示意图形(源自: arXiv)。

此外, 这或许也跟大模型自身的潜能存在关联, 借由激发促使其展现出来。这个观察于近期Meta的相关研究之中也得到了印证, 其有这样的发现, 运用一个视觉语言模型能够学到诸多很强的3D能力, 然而并不需要一个专门的3D专家模型。

在 PhysX - Bench 的开放场景评估里, PhysX - Omni 于材料层面创造了最佳成绩纪录, 在可供性方面创造了最佳成绩纪录, 在运动学范畴创造了最佳成绩纪录, 在描述维度创造了最佳成绩纪录, 展现出强泛化能力。

此外, 研究人员于大量真实场景案例里做了验证, 这类样本多数没法获取大规模的3D标注。不过, 能借由人工标注的办法制作少量标注数据, 用来判别结果。多组对照验证表明, 实测结果和仿真数据集得出的结论可以相互佐证。

刘子纬表示, 当前该领域所处的发展阶段, 跟大语言模型发展的早期极为相像。在早期的时候, 研究者们大多凭借各类经过仿真的数据、经由文本生成的数据来开展实验, 随后业界才渐渐构建起各类针对真实世界的基准测试集。这项研究还为后续的相关研究给予了新的启发, 特别适用于三维物理仿真领域的评测工作。

团队还对PhysX - Omni在下游任务里的实际价值做了验证, 这套资产针对市面上主流的仿真器, 完成了适配定制, 所以它能把生成的资产一键导入到物理仿真器, 用来供机器人进行操作策略学习, 在诸如打开马桶盖、操作咖啡机、旋转椅子、关闭柜门等接触丰富的交互任务当中, 生成的资产在动态交互里展现出结构稳定以及物理一致性, 不需要进行任何人工后处理。

除此以外, 将深度估计与图像分割技术相结合, PhysX - Omni 还能够从单张场景照片着手, 去重建 3D 布局, 并且自动填充仿真就绪资产, 以此达成场景级别的物理仿真环境构建。这意味着什么呢, 未来机器人训练、具身智能研究可能无需再花费大量人力去搭建虚拟场景, 而对整个仿真流程起到替代作用的恰恰就是一张实拍照片。

机器人训练的新“燃料”:AI 开始批量生产物理世界

以往, 在行业范围之内, 针对具身智能以及机器人训练而言, 存在着三条占据主流地位的技术路线, 它们分别是:仿真、人类数据以及实体真机实操。然而, 仿真方案之所以未曾切实地“投入使用”, 其确切原因在于, 物理仿真所呈现出的效果欠佳, 并且真实程度也存在欠缺。此项研究借助自行研发的资产, 展开了与其相关的具身智能策略学习方面的实验, 最终所得出的结果证实,仿真能够对智能策略起到极具成效的优化作用, 进而验证了仿真方案所具备的实用价值。

以应用角度加以考量, 这项技术有可能会在游戏以及影视工业(AR、VR)、交互内容类型场景之中率先得以落脚, 它具备着能够同全部资产展开真实物理交互的能力, 且还能够缩短物理特效跟互动场景的制作周期。

顺着技术在演进中得到的进展, 它存在着于具身智能范畴里加以运用的可能性, 会变为用以衔接识别物体和操作物体的桥梁, 促使AI达成对更真切的物理特性、精细程度的真正了解与达成, 并且能够和产生交互于物理世界。从更为长远的视角来看, 要是可以对物理仿真的精度予以更进一步的提高, 这项技术还有可能在AI for Science领域取代一部分具备高成本性质的实体科学实验。

据悉, 当下大晓机器人公司已把 PhysX - Omni 用在了其仿真平台上, 而且, 还有一些硅谷的初创公司对这项技术展现出了浓厚的兴趣, 在后续的研究阶段里, 研究团队打算持续探究怎样使长尾数据能够高效地学习, 怎样把物体级建模延伸到场景级建模, 并且让物体摆放方式的关系变得更为合理, 从而更贴近实际应用。

参考资料:

1.这并不是一个句子呀, 请你提供具体的句子以便我按照要求进行改写。

注:封面/首图由 AI 辅助生成