网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

大晓机器人与南洋理工S-Lab联手,Puffin-World开启机器人三维环境训练新范式

2026-09-10来源:互联网编辑:瑞雪

大晓机器人携手南洋理工大学S-Lab等机构,共同推出并开源了统一多模态世界模型框架Puffin-World,为空间智能与具身智能领域带来突破性进展。该框架首次将物理、几何和外观整合为三维世界的三种原生状态,构建了一个涵盖重力场感知、自由视点空间仿真、三维生成与重建以及闭环探索的完整系统,能够精准预测机器人行动后的世界状态变化。

Puffin-World的核心创新在于其统一的多模态架构。物理状态通过重力场与纬度图定义相机在真实世界中的绝对朝向;几何状态利用深度信息解析场景的三维结构与空间关系;外观状态则对应相机捕捉的RGB图像。三者共同构建了从"世界存在方式"到"交互逻辑"的完整表达体系。在生成新视角时,模型不仅需确保画面视觉合理,还需严格符合物理方向与三维结构约束。

为解决跨视角运动中的方向统一问题,研究团队提出Omni-Camera相机表示法。该技术将重力锚定的绝对相机信息与射线相对几何相结合,通过物理传播机制实现重力信息在连续视角中的稳定传递。实验表明,即使相机经历复杂旋转轨迹,生成画面的地平线仍保持稳定,场景上下关系与相机轨迹高度一致,有效避免了传统方法中常见的运动失真问题。

该框架突破性地实现了四大功能的统一:单图即可解析相机物理参数与场景语义;支持用户精确指定相机方向生成目标画面;能够从文字或图像生成具有一致空间结构的三维世界;更可形成"状态感知-动作预测-结果生成"的闭环探索系统。这些能力均基于统一的视觉-语言-相机表征体系,通过输入条件与视图角色的动态调整实现任务切换,更贴近机器人实际工作链路。

训练数据方面,研究团队构建了包含1500万组视觉-语言-相机三元组的Puffin-Cam-15M数据集,覆盖室内外、真实合成等多元场景,每组数据均标注相机姿态与视场角信息。配套的Puffin-Traj-1M数据集则提供100万条复杂旋转轨迹,包含360度环视等挑战性场景,重点强化模型对大幅旋转与长轨迹的理解能力。团队还为28个公开数据集补充了约4450万张图像的绝对相机位姿标注,为行业提供了大规模监督训练资源。

在基准测试中,Puffin-World展现出显著优势:在Stanford2D3D等四个相机理解基准上取得最佳中位误差,横滚角误差低至0.29度;在相机可控生成任务中,上方向误差仅0.84度,FID指标达75.93;三维世界生成测试的PSNR指标达17.22,视觉一致性显著优于对比方法。这些成果验证了框架在物理理解、空间控制、几何生成与三维重建间的协同优化能力。

目前,Puffin-World已完整开源代码、模型与数据集,涵盖从数据标注到模型评测的全技术链路。这一举措为机器人仿真、合成数据生成、虚拟现实等领域的研究提供了可复现的技术底座,有望推动世界模型从视觉内容生成向可感知、可校准、可探索的三维环境预测范式转变。

iPhone新机怎么选?Duo、Pro系列还是等标准版?一文说清!
在发布会上,苹果用来展示手机性能的游戏是《怪物猎人:旅人》,这款游戏当前安卓手机仍不能满帧运行,用其宣传iPhone 18 Pro/ProMax的性能,可见苹果的自信。 iPhone 18 Pro/Pro…

2026-09-10

京东JDD大会发布物理AI新成果:十万卡算力集群领航,加速AI跃迁物理世界
京东正将算力、数据、模型能力与供应链深度融合,应用到零售、物流、科技、健康、工业、产发、金融、外卖、家政等海量场景中,并向行业和社会开放,推动AI从数字世界走向物理世界,在千行百业和千家万户发挥重要价值。京…

2026-09-10

数字人技术革新:效率跃升场景拓展 商用落地仍需攻克多重挑战
但技术快速突破的另一面,高算力消耗、交互细节缺陷以及肖像版权等风险,依旧制约行业大规模商用,产业发展仍需要在技术体验、成本投入与合规管控之间做好统筹平衡。以数字人服装换装为例,行业同行完成同类项目周期长达6个…

2026-09-10

工业互联网与AI深度融合 开启数智转型绘就智慧生活新画卷
新华社沈阳9月10日电(记者武江民、洪可润)展厅内,参观者戴上科大讯飞智能眼镜,依托讯飞语音识别与AI翻译技术,英文讲解实时翻译为中文的同时,字幕也悬浮在镜片上;目光扫过外文展板时,眼镜自动识别文字完成翻译…

2026-09-10

蚂蚁集团战略入股戴盟机器人 触觉感知赛道布局再落关键一子
此前,蚂蚁集团已前瞻投资宇树科技、星海图、灵心巧手、苏度科技、舞肌科技等一批具身智能代表性企业,此次是其首次布局触觉赛道。 蚂蚁集团旗下的蚂蚁灵波科技在具身智能领域同步推进。在2026年外滩大会上,蚂蚁灵波展…

2026-09-10

从踩点到抵达:高德空间智能如何重塑出行,让真实世界触手可及?
这也是我体验完高德最新版本后一个很明显的感受:它正在从过去主要解决“怎么到”,进一步参与到出发前的判断、行程中的规划,以及抵达后的行动。这也不只是把摄像头画面叠加到导航界面上,导航 Live 会持续感知周…

2026-09-10

京东打造国产算力新引擎:十万卡集群蓄势待发,JoyAI模型引领行业革新
模型方面,京东已形成覆盖多模态模型、世界模型和具身模型的JoyAI基础模型矩阵。 1、本号不对发布的任何信息的可用性、准确性、时效性、有效性或完整性作出声明或保证,并在此声明不承担信息可能产生的任何责任、任…

2026-09-10

前OpenAI Sora负责人携手梦工厂创始人,共启AI视频创业新征程
该公司将开发新的视频模型,正值一些主要AI公司如OpenAI在美国收缩视频AI相关业务,而中国企业如字节跳动则大举推进,但面临严重的版权问题。 OpenAI今年早些时候关闭了Sora——该产品曾短暂登上苹果应…

2026-09-10

京东AI“破屏而出”:以供应链为基 构建物理世界智能新生态
9月9日,京东发布物理AI全景战略,开源了JoyAI-EchoWM实时可交互音视频世界模型;与合作伙伴打造十万卡国产算力集群的规划同步披露;1000万小时人类具身数据采集行动正在推进。 这样理解上述观点会更…

2026-09-10