网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

大晓机器人携手南洋理工S-Lab发布Puffin-World,开启三维空间智能新范式

2026-09-11来源:快讯编辑:瑞雪

大晓机器人与南洋理工大学S-Lab等机构联合研发的统一多模态世界模型框架Puffin-World正式开源,为空间智能与具身智能领域带来突破性进展。该框架首次将物理状态、几何状态与外观状态定义为三维世界的三种原生要素,通过整合重力场感知、自由视点仿真、三维重建及闭环探索能力,实现了对机器人行动后世界状态的精准预测。这一创新为机器人训练提供了更接近真实环境的支撑,解决了传统方法仅依赖视觉逼真度而忽视环境信息完整性的局限。

Puffin-World的核心创新在于其三维状态建模体系。物理状态通过重力场与纬度图定义相机绝对朝向,几何状态以深度信息刻画场景三维结构,外观状态则对应RGB图像输出。三者协同构建了从“世界本质”到“交互逻辑”的完整表达。例如,当模型生成新视角时,不仅需呈现符合视觉逻辑的画面,还需确保物理方向与空间结构的合理性。为统一绝对方向与跨视角运动,研究团队提出Omni-Camera相机表示法,将重力锚定的绝对信息与射线相对几何结合,使生成过程始终保持稳定的物理参照系,有效避免了地平线漂移或场景失真问题。

该框架的另一突破在于实现世界生成与重建的同步进行。传统方法需先生成视频再通过独立模块补充深度信息,而Puffin-World可在单次生成中联合输出RGB外观与深度几何数据。这一特性使其直接支持三维重建任务,例如从文字或少量图像生成符合指定相机轨迹的多视角数据,并汇聚为具有一致空间结构的三维场景。在闭环探索任务中,模型还能通过“状态感知-动作预测-结果生成-校准修正”的循环机制,自主修正相机姿态偏差,高效扮演世界行动模型(WAM)角色。

为支撑复杂空间理解能力,研究团队构建了包含1600万核心数据的Puffin-16M数据集。其中Puffin-Cam-15M提供1500万组视觉-语言-相机三元组,覆盖室内外、真实合成等多元场景,并标注不同分辨率、相机姿态及视场角信息;Puffin-Traj-1M则包含100万条挑战性旋转轨迹,涵盖连续俯仰、横滚及360度环视等复杂运动模式。团队还为28个公开数据集补充了约4450万张图像的绝对相机位姿标注,标注内容涵盖横滚角、俯仰角及视场角,为物理世界感知研究提供了大规模监督数据。

在技术验证环节,Puffin-World在四项基准测试中均取得领先成绩。在相机物理理解任务中,该模型在Stanford2D3D数据集上对横滚角、俯仰角的中位误差分别低至0.29度与0.53度;在相机可控生成测试中,其生成画面的重力方向误差仅为0.79度,FID指标达75.93;在三维世界生成任务中,PSNR指标达到17.22,显著优于对比方法。这些数据表明,该框架成功建立了相机理解、空间控制、几何生成与三维重建之间的协同机制,而非单纯优化单一任务表现。

目前,Puffin-World已同步开源代码、模型及数据集,形成覆盖数据标注、模型训练到效果评测的完整技术链路。这一开放策略将加速机器人仿真、合成数据生成及具身智能训练等领域的技术迭代,为三维内容生产与虚拟现实应用提供新的解决方案。通过将世界模型从视觉内容生成推向可感知、可校准的三维环境预测,该研究为机器人训练范式转型提供了关键技术支撑。

千亿规模后盒马“换挡”:从门店扩张到精益布局的新征程
这家门店是盒马在杭州开出的第一家店,经营已有9年。在品质消费、线下体验和线上订单都能够形成足够规模的区域,由盒马鲜生承接;在社区人口密度高、价格敏感度更高的市场,配置超盒算NB;最后通过配送节点补充线上需求…

2026-09-10

iPhone 18 Pro扩容新选择,aigo PL50磁吸存储盘解锁创作新体验
aigo PL50大果盘体验iPhone专属的“六边形战士”如果说硬件层面的磁吸设计,让PL50“大果盘”更容易融入iPhone的使用场景,那么软件层面的aigo Link,则进一步完善了它在移动拍摄和内…

2026-09-10

马斯克预言2027年AI包揽数字化工作,技术迭代下职场变革已近在眼前
作为深耕AI产业的观察者,结合当下大模型迭代速度、落地场景成熟度与产业进化规律来看,马斯克这一论断并非科技噱头,而是贴合AI技术质变逻辑、具备极高落地概率的行业趋势,一场针对数字化脑力劳动的全域替代浪潮,已然…

2026-09-10