刘慈欣最可怕预言,被李飞飞做出来了
22年前,刘慈欣在《镜子》里写了一个结局惨淡的故事:人类用超弦计算机复现了整个宇宙,得到了一面能看清任何时间、任何地点发生过什么的镜子。最后,绝对透明的文明失去了活力,人类在澄澈中枯萎。
这本来只是一个科幻设定。
北京时间9月2日,AI教母李飞飞和她的World Labs,把这个故事的第一章,做出来了一部分。正式发布“全球首个多模态世界模型” ----Atlas,它能以像素级相机控制生成图像与视频,并将画面重建为3D世界。
李飞飞本人将其称为“里程碑式”成果并在社交平台置顶,表示Atlas“为从视觉特效到机器人的众多应用场景打开了大门”。
英伟达机器人主管、同时也是李飞飞的学生Jim Fan等多位业内人士也称赞:
这是机器人领域Real-to-Sim(真实到仿真)的“一大步”。
这个场景和《镜子》有些相似:书里,白冰输入参数,计算机演化出整个宇宙;书外,人们给出提示词,模型生成出一方世界。
那么,这个敢以“首个多模态世界模型”加冠的Atlas,究竟能做什么?
Atlas----第一个尝试理解世界的模型
关于这个模型,按官方的说法,World Labs将Atlas称作Omni Model(“全模态模型”,从零开始预训练,原生处理文本、图像、视频和3D四门功课。
第一门是“轨迹拍摄”。
输入1-6张参考图,再画好想要的运镜轨迹,它就能生成最长一分钟、1440p的高清视频。
放在以前,在影视制作上,大家用视频模型生成的都清楚,控制镜头你就要在提示词里打“镜头向左平移”“俯拍仰拍”,这类含糊的文字描述,效果如何全凭运气。
有一种方法就是写出论文一样的提示词,将AI死死框在我们的文字下,但这也需要导演有极强的“空间想象力”,这样的人才不是没有,只是不多。
现在靠Atlas,这一步则省下不少导演的脑细胞,它把相机轨迹本身变成了输入,省下原本描述“轨迹”的那部分编写提示词的时间。
第二门是“3D建模”。
给它几张到几十张照片,它能重建出完整的3D空间,能直接输出游戏和VR行业可用的3D格式。
用上了真正的3D渲染技术,比如点云和高斯泼溅。
点云相当于把像素从照片里“立”进三维空间----成千上万个点,每个点记录一组空间坐标和颜色;3D高斯泼溅通俗说就是一小团有体积、会渐隐的颜料雾:中心最实,越往边缘越透明;这团雾还能拉伸、压扁、旋转,并携带自己的颜色和透明度。两者都是3D渲染的方式。


