{“error_msg”:””,”error_code”:””,”data”:{“title”:”刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位”,”content”:”## 刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位\n\n\n\n爱范儿2026年09月02日 09:59\n\n大模型理解文字,李飞飞想让 Atlas 理解空间\n\n前脚友商还在为你追我赶生成几秒钟的「电子榨菜」视频卷到头秃;后脚李飞飞创办的 World Labs 微微一笑,把桌子掀了—— \n\n**就在刚刚,全球首个多模态世界模型 Atlas 正式登场!**\n\n\n\n官方博客🔗 https://www.worldlabs.ai/blog/atlas \n\n按照官方定义,**Atlas 是一款面向空间智能的 omni world model,从零开始完成预训练,可以原生处理文本、图像、视频、相机位姿与 3D 深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。**\n\n\n\n先来看最直观的炸场操作: \n\nCamera Controlled Generation(相机控制生成)。 \n\n以前大家玩视频生成模型,多少有点玄学抽奖。我们在 Prompt 框里卑微敲下:「镜头缓慢向左拉升、绕着人物微仰角旋转」,回车之后全凭老天保佑。 \n\n\n\n**对比之下,Atlas 的做法是:直接把「相机位姿参数」当作底层原生输入。**\n\n你要什么角度、什么轨迹、走多快? \n\n直接给坐标! \n\n**只要丢进去 1 到 6 张普通照片,定好运镜轨迹,Atlas 就能生成最长达 1 分钟、1440p 分辨率 的大片。**\n\n画面不崩,空间几何丝滑一致,堪称外挂级运镜。 \n\n\n\n更夸张的是它的空间「脑补力」。 \n\n输入一张只拍到机器人正面的照片?Atlas 能把人家背影完完整整脑补出来; \n\n\n\n给一张泳池边角照?它靠着脑子里的「世界常识」,默默帮你把隔壁没拍到的草坪和远山给修好了。 \n\n\n\n从官方放出的 Demo 来看,Atlas 在镜头运动和空间一致性上确实比普通视频生成模型更进一大步。 \n\n**不过,镜头一旦进入原图没有拍到的区域,Atlas 实际上仍然需要依赖模型先验去猜,视角跨度越大、生成路径越长,局部几何漂移、物体形状变化和纹理闪烁也越容易暴露出来。**\n\n换句话说,它生成的更像是一个视觉上合理的三维世界,未必就是原来那个世界的精确数字复刻。 \n\n而种种操作的背后,也绕不开一个名为 Spatial Context(空间上下文)的行业术语。 \n\n大语言模型看上文接下文,Atlas 则是给每张图片绑死三维坐标和深度,在脑子里搭出一个带轴网的房间。 \n\n说得更直白一点,Atlas 很多能力的底层,其实都绕不开 **多视角合成** 。 \n\n\n\n它会把来自不同角度、不同机位的图片和视频,一起塞进同一个三维空间里,先判断它们彼此之间的相对位置,再补足没拍到的区域,继续生成新的视角。 \n\n单张图输入时,它更多依赖模型先验去「脑补」世界;输入视角一旦变多,它就更像是在做一次带空间约束的多视角融合,把零散画面慢慢拼成一个连续、可漫游的三维场景。 \n\n甚至你随便抓两张八竿子打不着的照片往空间里一扔,Atlas 都能强行给你脑补出走廊、大门和房间,把俩场景无缝焊在一起。 \n\n导演系同学看到这里,战术沉默,缓缓打出一个问号:合着以后运镜不用实拍,直接在电脑里「云开机」就完事了? \n\n除此之外,Atlas 还有第二张王牌:**Spatial Reconstruction(空间重建)。**\n\n传统的 3D 高斯泼溅(3D GS)或者点云扫描,得扛着专业设备围着目标转几十圈,拍几百上千张照片,费钱又费腿。 \n\n\n\n但 Atlas 再次露出神秘的微笑:**一边去,哪来这么多的规矩。**\n\n\n\n官方直接甩出了一个斯坦福大学 Main Quad 案例,只需把 2 到 25 张游客视角的地面平拍照片塞进去,就能轻松还原草坪、拱廊以及纪念教堂外墙的全部细节。 \n\n\n\n镜头随后直接拔地而起,来了一段上帝视角航拍的漫游。 \n\n在 DTU、ETH3D、ScanNet 等一堆公开数据集上,专门测稀疏视角重建误差(AbsRel ×10⁻³):Atlas 拿下了 25.3 的分数**(分数越低越好)** 。 \n\n对比之下,Pi3X 是 28.7,Depth Anything 3 飙到 39.3,MapAnything 更是高达 47.7。 \n\n\n\n而且输出直接对接点云和 3D Gaussian Splatting
原文链接:36氪