网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

Atlas突破几何重建壁垒,世界模型迈向虚实融合新征程

2026-09-16来源:互联网编辑:瑞雪

世界模型领域正经历一场从理论到实践的关键转型,各大科技企业纷纷加速布局,技术路线差异逐渐显现。在这场竞赛中,World Labs推出的多模态世界模型Atlas成为行业焦点,其独特的设计理念为理解世界模型的发展方向提供了新视角。

与传统的视频生成模型不同,Atlas突破了单纯追求视觉效果的局限。当输入几张普通照片时,它能够精准重建出对应的3D场景,输出点云、3D高斯泼溅等计算机可直接解析的几何数据。这种能力使机器人仿真器可以直接导入运行,为数字空间与物理世界的交互奠定了基础。相比之下,视频生成模型更关注像素连贯性和视觉逼真度,最终交付的是供人观看的视频文件,而Atlas构建的是机器人可直接"工作"的数字环境。

Atlas的核心创新在于对空间上下文的深度理解。传统视觉系统处理的是二维像素阵列,缺乏深度、尺度和遮挡关系等三维信息。Atlas通过为每张照片赋予三维坐标,将视觉输入从"拍到了什么"转变为"从哪拍的、和周围什么关系"。这种转变使模型能够识别照片拍摄方向和相互关系,例如通过分析同一房间不同角度的五张照片,就能拼合成完整的三维地图,而非简单的画面拼接。

在3D场景构建方面,Atlas显著降低了技术门槛。传统方法需要专业设备拍摄数百张照片并花费数天手工建模,而Atlas仅需2至25张普通照片即可完成重建。斯坦福大学主方庭的案例显示,仅凭几张手机拍摄的地面照片,系统就能生成校园高空俯瞰的连续飞行画面。这种效率提升使3D场景生成从专业测绘领域扩展到普通工程师的日常工作中。

时空模拟能力是Atlas的另一大突破。用户输入1至6张参考图并设计相机运动轨迹后,系统可生成最高1440p分辨率、时长1分钟的视频。第三方盲测结果显示,在复杂运镜场景中,Atlas对MiniMax H3的胜率达75%,对阿里HappyHorse 1.1的胜率达86%,对字节Seedance 2.5的胜率更高达94%。这种基于坐标的渲染方式,相比传统文本提示控制运镜的方法,在精度上具有明显优势。

更值得关注的是Atlas在机器人训练中的应用潜力。通过同步录制的多段手机视频,系统不仅能实现时间冻结和多视角回看效果,还能重建3D场景并模拟不同机器人的运动路径。这种能力使数据采集主体从真实机器人转向虚拟机器人,物理世界的一次行走可在数字世界中重复使用上千次,大幅降低训练成本。更重要的是,系统将环境重建和传感器渲染统一在单一模型中,消除了传统流程中环节间的误差传递,使虚拟训练数据与真实世界高度一致。

尽管Atlas在几何重建方面取得突破,但物理属性模拟仍是待解难题。当前系统生成的传感器数据仅包含RGB图像和深度图,缺乏碰撞检测、动力学参数等物理信息,需要依赖外部物理引擎完成演算。World Labs已通过收购机器人仿真公司SceniX来弥补这一短板,双方计划结合空间建模与物理仿真技术,构建完整的Real-to-Sim-to-Real工作流。近期演示中,机械臂在零真实数据的情况下成功完成线缆操作和可变形物体操控任务,验证了技术路线的可行性。

这场技术变革正在重塑具身智能行业的发展轨迹。数据采集的重点从"获取更多照片"转向"提取物理信息",但完全模拟真实物理特性仍面临挑战。线缆阻尼、布料编织方式、关节摩擦特性等细节,仍需通过真实物理交互来标定。当几何重建与物理规则真正统一时,世界模型或将推动具身智能行业进入新的发展阶段。