首个支持物理仿真的三维生成模型来了!
仅凭借一张平平无奇的照片, AI便能够直接生成3D数字模型, 还能预测诸如重量、软硬以及关节活动等真实存在的物理属性, 这意味着, AI所生成的不再仅仅是与照片描述模样相像的资产, 而是切实能够与物理世界展开交互, 并且有希望对具身智能、物理AI、AI for Science的模型直接展开训练。
近期, 刘子纬副教授所在的新加坡南洋理工大学团队, 开发出了统一的三维生成框架PhysX-Omni, 此框架打通了刚体、可变形体、关节体(铰链体)这三类资产的物理级3D生成。他们发明了一种编码办法, 叫模板化游程编码, 这个编码不仅能直接使语言模型读懂三维结构, 还会让生成性能显著提升。
刘子纬向DeepTech表明, 以往3D模型生成得开展实际扫描与采集, 然而鉴于价格高昂且无法实现规模化, 所以并不契合大模型的可扩展性。并且, PhysX - Omni开启了近乎没有穷尽的生产模式, 这等同于去做数据基建, 它持续为物理AI生产供给训练素材。
PhysX - Omni能生成详细且通用的3D资源, 这些资源涵盖刚体、可变形物体以及关节体, 还能生成适用于下游应用的仿真就绪物理资产,来源是arXiv。
PhysX - Omni的模型仅有7B, 即Qwen2.5 - VL - 7B - Instruct , 其总体推理成本很低, 据研究人员预估, 该模型成本在传统仿真软件成本的十分之一到二十分之一之间, 更值得关注的是, 该模型的绝对尺度预测误差从约300降到了2.79 , 整整提升了两个数量级, 这意味着, 由AI生成的椅子不再是那种模糊表述的“大约这么高”, 而是精准明确说明高度的“就是65厘米高”。
PhysX - Omni在仿真就绪场景生成里表现出应用潜力, 此场景有机器人策略学习等情况, 其应用潜力还体现在具身智能领域, 也体现在物理仿真领域, 还体现在游戏领域, 也体现在影视等领域。相关论文题目是“PhysX - Omni: Unified Simulation - Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects”, 该论文发表在了预印本网站arXiv。
让 AI 学会物理常识:从“看得美”到“能交互”
要是我们打算借助AI去创造一个箱子, 多数模型不清楚该用多大的力量去推搡它, 在存在风吹的情形下它是否会倒伏 , 或者会移动多少长短的距离。当下有着3D模型生成好似“真空中的球形鸡”这般的状况, 即便整体呈现得较为美观, 然而与外界不存在任何的交互 , 常常会出现穿模 , 漂浮 , 关节胡乱转动等方面的问题。
往昔的三维范畴中, 刚体被单独研究, 可变形体被单独研究, 关节体也被单独研究。研究团队发觉, 这三个子领域根本上讲或许是同一个问题, 所以除数字世界能用同一套代码外, 物理世界背后的结构实际上也有可能凭借一套代码来予以表示。
此研究等同于给AI赋予了物理常识, 把3D模型生成从单纯生成得美观, 转变成可以实现交互并且好用, 不但能够推动跨类型学习, 还削减了开发成本与门槛。
拿机器人折叠衣物当作实例, 衣物属于那种能够变形的事物, 将它折叠完备后放置进箱子里时, 它是一种刚体;随后把衣柜 door 打开着, 衣柜在此情形下成为关节体。在晓得怎样去折叠衣物这件事情之后, 或许这种认知反过来能够对完成一些别的任务做出些许帮助。
面对一张完整的或者是部分被遮挡的图像, PhysX - Omni先是推导出高层次的整体信息, 接着运用多轮生成流程来生成详细的部件级几何结构。鉴于全局表示和局部表示之间具备固有的关联, 这些输出结果能够直接被整合成为可用于仿真的物理三维资源(源自: arXiv)。
理查德·萨顿, 这位被称作强化学习之父的人,在一篇名为《苦涩的教训》的经典文章里提到, 只要数据量达到足够多的程度, 中间产物有可能会自然而然地涌现出来, 所以只需要确定好最终目标就行。刘子纬表示, “我们最原初的设计哲学也受到了这种观点的启发, 期望尽可能地去实现端到端的学习。”。
以往的研究存在两种情况, 一种是进行压缩结果把细节给弄丢了, 另一种是运用分割模块从而引入了错误。而PhysX - Omni采用了全新的几何表达方式, 这种方式是把每个部件的三维网格沿着Z轴切成一层一层的二维掩膜, 之后基于经典的游程编码, 再把每个切片压缩成文本串。
既保留了高分辨率的结构信息, 又绕过了中间表征进行直接建模, 其模板RLE表示从而减少了误差累积, 新编码方式最直观的变化表现在两方面, 一是高度保持3D细节, 二是高效, 即编码同样的信息, 可比之前工作再少1/4到1/5的tokens。
PhysXVerse 的统计与分布(来源:arXiv)
研究人员构建了首个通用仿真就绪 3D 数据集 PhysXVerse 来训练该框架, 它是从 PartVerse 的精细标注里筛选过滤而来的, 保留了超过 8,700 个高质量资产, 覆盖 2,900 多个室内外类别, 这些类别包括直升机、坦克、赛车、摩天大楼以及玩具等, 部件数量从单个刚体一直延伸至有 65 个零件的复杂铰接系统。
每一个资产, 在具备几何网格的情形以外, 还借助人工校验这种方式, 把绝对尺寸、材质类型、功能语义、关节类型以及运动范围等物理标注进行补齐。
误差骤降 100 倍,一张照片生成仿真级 3D 资产

然而, 仅仅具备数据以及模型是不足够的, 为了能够在开放环境里更加全面且灵活地评估生成与理解能力, 研究团队还打造了评测基准 PhysX-Bench, 它覆盖了六个关键属性维度, 分别是几何、绝对尺度、材料、可供性(物体能够被怎样操作)、运动学以及描述。
这一套评测所具备的巧妙之处在于, 它并不是依靠价格高昂的真实标注, 而是运用仿真去加以测量物理方面, 这样做不但规避了人工标注所产生的主观性, 而且还能够更加真实地展现出资产在实际进行部署时的表现。
显示 PhysXVerse 数据集结果, PhysX - Omni 的 PSNR 是 21.52, Chamfer Distance 降低到 2.95, F - score 达到 91.28, 几何精度全面超过此前最优方法。更值得留意的是绝对尺度误差: 从 PhysXGen 的 309.31 急剧下降到 2.79, 几乎提高了两个数量级。
出乎我们意料的是, 刘子纬表示, PhysX - Omni在绝对尺度误差方面的表现。这和研究团队的两个观察紧密相关。其一, 许多此前的数据, 被研究人员发现天然带有幻觉, 于是, 他们对数据进行了重新编排以及清洗。其二, 借助新的编码方式, 它对绝对尺度的分辨率大幅提高, 从而, 能更精准地理解真实世界里物体的尺寸。
(a)于三维建模里头, 不同几何呈现方式加以对照比较;(b)PhysX - Omni的详尽几何呈现示意图形(源自: arXiv)。
此外, 这或许也跟大模型自身的潜能存在关联, 借由激发促使其展现出来。这个观察于近期Meta的相关研究之中也得到了印证, 其有这样的发现, 运用一个视觉语言模型能够学到诸多很强的3D能力, 然而并不需要一个专门的3D专家模型。
在 PhysX - Bench 的开放场景评估里, PhysX - Omni 于材料层面创造了最佳成绩纪录, 在可供性方面创造了最佳成绩纪录, 在运动学范畴创造了最佳成绩纪录, 在描述维度创造了最佳成绩纪录, 展现出强泛化能力。
此外, 研究人员于大量真实场景案例里做了验证, 这类样本多数没法获取大规模的3D标注。不过, 能借由人工标注的办法制作少量标注数据, 用来判别结果。多组对照验证表明, 实测结果和仿真数据集得出的结论可以相互佐证。
刘子纬表示, 当前该领域所处的发展阶段, 跟大语言模型发展的早期极为相像。在早期的时候, 研究者们大多凭借各类经过仿真的数据、经由文本生成的数据来开展实验, 随后业界才渐渐构建起各类针对真实世界的基准测试集。这项研究还为后续的相关研究给予了新的启发, 特别适用于三维物理仿真领域的评测工作。
团队还对PhysX - Omni在下游任务里的实际价值做了验证, 这套资产针对市面上主流的仿真器, 完成了适配定制, 所以它能把生成的资产一键导入到物理仿真器, 用来供机器人进行操作策略学习, 在诸如打开马桶盖、操作咖啡机、旋转椅子、关闭柜门等接触丰富的交互任务当中, 生成的资产在动态交互里展现出结构稳定以及物理一致性, 不需要进行任何人工后处理。
除此以外, 将深度估计与图像分割技术相结合, PhysX - Omni 还能够从单张场景照片着手, 去重建 3D 布局, 并且自动填充仿真就绪资产, 以此达成场景级别的物理仿真环境构建。这意味着什么呢, 未来机器人训练、具身智能研究可能无需再花费大量人力去搭建虚拟场景, 而对整个仿真流程起到替代作用的恰恰就是一张实拍照片。
机器人训练的新“燃料”:AI 开始批量生产物理世界
以往, 在行业范围之内, 针对具身智能以及机器人训练而言, 存在着三条占据主流地位的技术路线, 它们分别是:仿真、人类数据以及实体真机实操。然而, 仿真方案之所以未曾切实地“投入使用”, 其确切原因在于, 物理仿真所呈现出的效果欠佳, 并且真实程度也存在欠缺。此项研究借助自行研发的资产, 展开了与其相关的具身智能策略学习方面的实验, 最终所得出的结果证实,仿真能够对智能策略起到极具成效的优化作用, 进而验证了仿真方案所具备的实用价值。
以应用角度加以考量, 这项技术有可能会在游戏以及影视工业(AR、VR)、交互内容类型场景之中率先得以落脚, 它具备着能够同全部资产展开真实物理交互的能力, 且还能够缩短物理特效跟互动场景的制作周期。
顺着技术在演进中得到的进展, 它存在着于具身智能范畴里加以运用的可能性, 会变为用以衔接识别物体和操作物体的桥梁, 促使AI达成对更真切的物理特性、精细程度的真正了解与达成, 并且能够和产生交互于物理世界。从更为长远的视角来看, 要是可以对物理仿真的精度予以更进一步的提高, 这项技术还有可能在AI for Science领域取代一部分具备高成本性质的实体科学实验。
据悉, 当下大晓机器人公司已把 PhysX - Omni 用在了其仿真平台上, 而且, 还有一些硅谷的初创公司对这项技术展现出了浓厚的兴趣, 在后续的研究阶段里, 研究团队打算持续探究怎样使长尾数据能够高效地学习, 怎样把物体级建模延伸到场景级建模, 并且让物体摆放方式的关系变得更为合理, 从而更贴近实际应用。
参考资料:
1.这并不是一个句子呀, 请你提供具体的句子以便我按照要求进行改写。
注:封面/首图由 AI 辅助生成