发生了什么
9 月 17 日,英伟达与 World Labs 联合展示了一项空间智能演示:输入 32 张英伟达总部 Voyager 园区的照片,Atlas 世界模型即可重建出可在其中实时穿行的三维场景。演示中,用户可自行选择路径、查看园区任一指定区域,相机视角可精确控制。World Labs 与英伟达方面均确认,Atlas 在英伟达 Blackwell GPU 上完成从零预训练。
同一场发布中,World Labs 公布了零样本全自主无人机飞行结果。其具身基础模型把内部世界模型、具身推理与直接控制统一在同一模型内,无需预先建图或针对特定场景训练即可完成飞行。
- 输入规模:32 张园区照片。
- 输出形态:可在其中实时漫游的三维场景,支持自选路径与精确相机控制。
- 多模态底座:Atlas 把文本、图像、视频与 3D 数据纳入统一的空间上下文,同一模型承担新视角生成、场景重建与世界模拟三类任务。
- 训练与算力:从零预训练,算力平台为英伟达 Blackwell GPU。
- 实机验证:World Labs 称曾在 Atlas 生成的环境中让 5 个机器人平台各连续运行 1 小时,期间无需人工干预。
为什么重要
世界模型的核心价值主张是样本效率。机器人、自动驾驶等物理 AI 场景的真实数据采集成本高、极端工况难以复现;若模型能用有限真实数据构建可模拟环境,智能体便可先在虚拟空间中反复试错,再进入现实执行。Atlas 试图解决的正是这一环——把现实场景低成本转化为可交互的仿真环境。
从技术路线看,Atlas 的一个特点是重建与生成共用同一网络:既能从多视角照片恢复场景几何,也能对输入中不存在的视角进行外推,例如从一张街景照片生成该街区的俯瞰视图。对机器人应用而言更关键的一点是「环境与机器人的传感器视图来自同一个模型」,这使仿真环境与实机感知在数据分布上更为接近,有助于缩小仿真到实机的迁移落差。
尚待观察
需要指出的是,上述结果均为厂商在自选测试集上的自评数据。World Labs 承认「没有任何单一基准能够完整刻画 Atlas 的能力」;其与视频模型的偏好对比测试,所选择的也恰是 Atlas 被专门优化的相机控制任务。重建类对比虽基于 DTU、ETH3D、KITTI、ScanNet 等公开数据集,但目前尚无独立第三方复现。此外,Atlas 于 9 月 2 日发布,本次为围绕英伟达园区的实机演示,其能力边界与商用可得性仍待验证。

