正在阅读:

闪电快讯|大晓机器人联合南洋理工发布统一多模态世界模型,已在四项测试中取得SOTA成绩

扫一扫下载界面新闻APP

闪电快讯|大晓机器人联合南洋理工发布统一多模态世界模型,已在四项测试中取得SOTA成绩

「电厂」获悉,近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。

闪电快讯|大晓机器人联合南洋理工发布统一多模态世界模型,已在四项测试中取得SOTA成绩

Puffin-World可建模出原生世界状态:外观-几何-物理,图/大晓机器人

「电厂」获悉,近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,可预测机器人行动后世界将处于什么状态。

Puffin-World同步开源了代码、模型和Puffin-16M数据集,包括1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,并开放覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。

这是一套从数据、标注、训练到评测的完整技术链路,可助力研究机构和产业开发者围绕机器人仿真、合成数据、虚拟现实、三维内容生产与具身智能开展后续开发。

机器人训练来说需要的并不是一段视觉上逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分,物理方向、空间几何和视觉外观共同构成机器人真正需要的训练环境。

而Puffin-World从三维世界状态本身出发,将其建模为三种相互关联的原生状态:

物理状态:描述相机和观测视角在真实世界中的绝对朝向,包括重力场与纬度图。

几何状态:通过深度信息表达场景的三维结构、空间远近和表面关系。

外观状态:对应相机最终观察到的RGB图像。

三种状态共同构成从“世界如何存在”到“世界如何被交互”的完整表达。模型生成新视角时,不仅要回答画面应该是什么样,还要保证该画面在物理方向和三维结构上成立。

Puffin-World可以在一个模型中统一四类过去往往需要不同系统分别完成的任务,分别是:

第一,单图理解相机物理信息。输入一张图片,模型能够结合地平线、垂直结构和场景构图进行空间推理,预测相机相对于真实物理世界的横滚角、俯仰角和垂直视场角,同时生成场景语义描述。模型不仅识别“图中有什么”,还理解“当前视角以怎样的姿态看到了它”。

第二,自由视点空间仿真。除文字描述外,用户还可以明确指定相机方向和视场角。模型据此生成符合目标机位的画面,使文生图从内容控制进一步走向精确的空间控制。

第三,三维世界生成与重建。模型可以从文字、单张图像或少量参考图像出发,按照指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度。不同视角随后可以汇聚为具有一致空间结构的三维世界。

第四,闭环自校准探索。当相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成“状态感知—动作预测—结果生成—再次校准”的闭环,高效扮演World Action Model (WAM)角色。技术报告还展示了模仿式世界探索能力,即从同一初始视角出发,按照给定相机轨迹扩展并探索新的三维世界。

目前,Puffin-World的统一能力已经在四项Benchmark中取得SOTA成绩。

在相机到真实世界理解任务上,Puffin-World在Stanford2D3D、MegaDepth、TartanAir和LaMAR四个公开基准上取得最佳或并列最佳的中位误差,并在大多数AUC指标上领先。

(Puffin-World的统一能力在四项Benchmark中取得SOTA成绩)

世界模型能否理解复杂空间,很大程度上取决于训练数据是否同时具备视觉内容、场景语义、绝对相机信息和多样化运动。Puffin-16M数据集在此背景下构建,包含两个组成部分:

Puffin-Cam-15M提供1500万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成等多种场景,并包含不同分辨率、宽高比、相机姿态和视场角。它不仅告诉模型图像中有什么,还告诉模型这张图像是在怎样的相机观测条件下形成的。

Puffin-Traj-1M则提供100万条具有挑战性的旋转轨迹,覆盖连续俯仰、横滚、偏航、复合运动以及360度环视等复杂情况,重点补足传统三维数据集在大幅旋转和长轨迹探索方面的不足。

与主要描述视角之间相对变化的数据不同,Puffin-16M进一步引入相机相对于重力和真实世界的绝对方向。模型不仅学习“相机从上一帧移动了多少”,还要理解“相机当前在世界中处于什么方向”。

除自建数据集外,团队还利用Puffin-World精准的物理世界感知能力为28个公开数据集补充绝对相机位姿标注,覆盖约4450万张图片,包括ImageNet、CC12M、Objects365、ScanNet、DL3DV和GPIC等。标注内容包括横滚角、俯仰角和视场角,可用于研究不同视觉数据中的机位偏差,也可为相机条件生成、物理世界理解和空间智能训练提供大规模监督。

(文中图源大晓机器人。)

本文为转载内容,授权事宜请联系原著作权人。

评论

暂无评论哦,快来评价一下吧!

下载界面新闻

微信公众号

微博

闪电快讯|大晓机器人联合南洋理工发布统一多模态世界模型,已在四项测试中取得SOTA成绩

「电厂」获悉,近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。

闪电快讯|大晓机器人联合南洋理工发布统一多模态世界模型,已在四项测试中取得SOTA成绩

Puffin-World可建模出原生世界状态:外观-几何-物理,图/大晓机器人

「电厂」获悉,近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,可预测机器人行动后世界将处于什么状态。

Puffin-World同步开源了代码、模型和Puffin-16M数据集,包括1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,并开放覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。

这是一套从数据、标注、训练到评测的完整技术链路,可助力研究机构和产业开发者围绕机器人仿真、合成数据、虚拟现实、三维内容生产与具身智能开展后续开发。

机器人训练来说需要的并不是一段视觉上逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分,物理方向、空间几何和视觉外观共同构成机器人真正需要的训练环境。

而Puffin-World从三维世界状态本身出发,将其建模为三种相互关联的原生状态:

物理状态:描述相机和观测视角在真实世界中的绝对朝向,包括重力场与纬度图。

几何状态:通过深度信息表达场景的三维结构、空间远近和表面关系。

外观状态:对应相机最终观察到的RGB图像。

三种状态共同构成从“世界如何存在”到“世界如何被交互”的完整表达。模型生成新视角时,不仅要回答画面应该是什么样,还要保证该画面在物理方向和三维结构上成立。

Puffin-World可以在一个模型中统一四类过去往往需要不同系统分别完成的任务,分别是:

第一,单图理解相机物理信息。输入一张图片,模型能够结合地平线、垂直结构和场景构图进行空间推理,预测相机相对于真实物理世界的横滚角、俯仰角和垂直视场角,同时生成场景语义描述。模型不仅识别“图中有什么”,还理解“当前视角以怎样的姿态看到了它”。

第二,自由视点空间仿真。除文字描述外,用户还可以明确指定相机方向和视场角。模型据此生成符合目标机位的画面,使文生图从内容控制进一步走向精确的空间控制。

第三,三维世界生成与重建。模型可以从文字、单张图像或少量参考图像出发,按照指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度。不同视角随后可以汇聚为具有一致空间结构的三维世界。

第四,闭环自校准探索。当相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成“状态感知—动作预测—结果生成—再次校准”的闭环,高效扮演World Action Model (WAM)角色。技术报告还展示了模仿式世界探索能力,即从同一初始视角出发,按照给定相机轨迹扩展并探索新的三维世界。

目前,Puffin-World的统一能力已经在四项Benchmark中取得SOTA成绩。

在相机到真实世界理解任务上,Puffin-World在Stanford2D3D、MegaDepth、TartanAir和LaMAR四个公开基准上取得最佳或并列最佳的中位误差,并在大多数AUC指标上领先。

(Puffin-World的统一能力在四项Benchmark中取得SOTA成绩)

世界模型能否理解复杂空间,很大程度上取决于训练数据是否同时具备视觉内容、场景语义、绝对相机信息和多样化运动。Puffin-16M数据集在此背景下构建,包含两个组成部分:

Puffin-Cam-15M提供1500万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成等多种场景,并包含不同分辨率、宽高比、相机姿态和视场角。它不仅告诉模型图像中有什么,还告诉模型这张图像是在怎样的相机观测条件下形成的。

Puffin-Traj-1M则提供100万条具有挑战性的旋转轨迹,覆盖连续俯仰、横滚、偏航、复合运动以及360度环视等复杂情况,重点补足传统三维数据集在大幅旋转和长轨迹探索方面的不足。

与主要描述视角之间相对变化的数据不同,Puffin-16M进一步引入相机相对于重力和真实世界的绝对方向。模型不仅学习“相机从上一帧移动了多少”,还要理解“相机当前在世界中处于什么方向”。

除自建数据集外,团队还利用Puffin-World精准的物理世界感知能力为28个公开数据集补充绝对相机位姿标注,覆盖约4450万张图片,包括ImageNet、CC12M、Objects365、ScanNet、DL3DV和GPIC等。标注内容包括横滚角、俯仰角和视场角,可用于研究不同视觉数据中的机位偏差,也可为相机条件生成、物理世界理解和空间智能训练提供大规模监督。

(文中图源大晓机器人。)

本文为转载内容,授权事宜请联系原著作权人。