李飞飞发布Atlas:全球首个,1分钟1440P深蓝AI
几张照片替代几百个机位」
给你两张八竿子打不着的照片——一间客厅、一段走廊。Atlas 能自己"补"出一截过渡空间:客厅的墙开出一道门,门后连着走廊,镜头推过去,两幅画面在同一个三维坐标里严丝合缝地接上。
这不是演示特效,而是 World Labs 发布的新世界模型 Atlas 的核心能力之一。
这家由李飞飞创立、主攻"空间智能"的公司,想用一套权重同时干完四件事:按给定机位生成视频、用少量照片重建场景、把手机短视频变成可自由穿行的"子弹时间"、以及从文字直接出图和 360° 全景。
官方称它为"全能世界模型"(omni world model)。
在它之前,这四件事分属四个赛道,模型架构与训练数据几乎互不相通。Atlas 凭什么把它们装进一套权重?又能装到什么程度?
视频生成、三维重建、世界模型:三家各守一摊
先说清楚 Atlas 要打的是谁。
要么会画不会建,要么会建不会画,要么能演但摸不着。
Atlas 的设计思路,就是不在"生成"与"重建"之间二选一——所有输入图像都绑定真实(或给定)的三维相机位姿,组成一份共享的"空间上下文"。这是理解全文的关键词。
您的浏览器不支持 video 标签
图 | 单图逐步补全场景示意图:输入1/2/3张地面照片,逐步补全整个场景,输入越多,模型想象成分越少,还原真实细节越多。©【深蓝 AI】编译
四大核心能力:从可控生成到机器人仿真
整套能力可以划分相机控制生成、空间重建、时空模拟、图像全景生成四大模块。
四项能力共用同一套底层,而每一项对应的,恰是此前的一个独立赛道。
2.1 相机可控生成:把镜头参数直接喂给模型
传统视频生成,镜头是prompt里的一段文字;Atlas直接把相机的位置、旋转作为原生输入。
输入1‑6张参考图像,用户自定义完整相机运动路径,模型按照给定轨迹生成最高1440p、最长一分钟的连贯视频,并且保持场景物体几何一致性,向外推演输入画面没有拍到的区域。
图 | 空间上下文拼接生成效果图:两张来源完全不同的参考图像赋予各自3D位置,模型生成中间过渡场景与通道。©【深蓝 AI】编译
图 | 多相机路径生成效果图:同一套输入图像,生成多条完全不同的相机飞行轨迹,场景内容保持一致©【深蓝 AI】编译
您的浏览器不支持 video 标签
图 | 多机位视频重构图(子弹时间效果)示意图:少数普通手机拍摄的视频输入,冻结时间,生成任意角度的镜头画面。©【深蓝 AI】编译
2.4 图像与全景生成
图像生成属于附加能力,并非Atlas核心定位。支持复杂文本提示生成图片、360°等矩形全景图,支持渲染画面内文字、多种艺术风格。
底层架构:多模态自回归扩散Transformer
Atlas是从零预训练的多模态自回归扩散Transformer,融合LLM、扩散图像模型两类架构的特点:
图 | Atlas模型架构逻辑框图:文本、图像、相机、深度构成空间上下文,自回归扩散Transformer逐元素生成视频帧与深度。©【深蓝 AI】编译
Atlas 带来的最大启发,不在于生成酷炫的一分钟长视频,而在于把相机位姿提升到模型原生输入的设计思想,重新定义了视觉世界模型的交互接口。
过去绝大多数视频生成、多模态模型,把相机运动当成文本附属描述,相当于 “用语言间接下达运动指令”,天然就存在翻译损耗。


