锐意创新 · 敏锐洞察 · 锐不可当

李飞飞发布Atlas:用几张照片替代几百个机位,全球首个多模态世界模型正式登场

电影导演还在为一场戏的运镜调度焦头烂额时,World Labs直接把摄影棚搬进了电脑。输入1到6张随手拍摄的照片,设定好运镜轨迹,1分钟1440p分辨率的三维镜头随即生成。照片没拍到的背后场景,模型靠“世界常识”自动补全,连泳池边被遮挡的草坪和远山都能脑补出来。

希鸥网观察到,这只名为Atlas的模型,由斯坦福大学教授、ImageNet之父李飞飞于2017年联合创办的World Labs正式推出,是全球首个多模态世界模型,垂直扎根空间智能赛道,为导演、游戏场景生产者与空间计算开发者解决三维内容制作成本高、周期长的痛点。其差异化钩子在于把相机位姿参数作为原生输入,生成视频具备几何一致的运动轨迹,而非靠提示词“玄学抽奖”。

拆解Atlas的技术底座,核心词叫空间上下文。大语言模型靠上文接下文,Atlas给每张图片绑死三维坐标与深度信息,在内部搭建出带轴网的虚拟房间。输入单张图时,它靠模型先验“脑补”未见区域;输入多视角图片时,它做的是带空间约束的多视角融合,把零散画面拼接成连续可漫游的三维场景。

硬数据最能说明问题。在DTU等公开数据集上,Atlas的稀疏视角重建误差拿下25.3的成绩,Pi3X是28.7,Depth Anything 3达到39.3,MapAnything高达47.7,数值越低精度越高。传统3D高斯泼溅需要专业设备围着目标拍摄几百上千张照片,Atlas只需2到25张普通照片就能交付,重建结果直接对接点云与3D Gaussian Splatting渲染管线。

这套技术路线的底层商业逻辑,是把三维空间生产方式从“测量驱动”切换为“生成驱动”。过去重建真实场景,物理测量是绝对成本大头;到Atlas这里,物理测量被压缩到最小,模型先验承担了大部分推断工作。成本结构彻底改变,行业门槛随之骤降。

希鸥网认为,这轮技术外溢的第一批受损者,是还在靠文本提示词艰难控制运镜的视频生成模型厂商。Atlas切入的赛道看似不同,但客户画像高度重叠,都盯着内容生产者的时间和预算。更值得关注的是赢家:影视虚拟预演、建筑可视化、XR内容生产等垂直场景,首次拿到低成本的稠密空间重建方案。博弈焦点正从“生成什么”转向“生成的三维世界是否自洽”。

对创业者而言,Atlas带来的启示不在参数,而在选择。当整个行业追逐最新最热的视频生成时,World Labs选了更难但更底座的路——空间智能。这提醒创业者在技术方向取舍上,选择最好而不必最新的,往往是更聪明的决策。短期流量属于追赶热点的人,长期壁垒属于占据底层生态的公司。

同时要警惕过度分析细节的陷阱。今天一个模型炸场,明天一个产品亮相,单个Demo只是来自某一时刻的一条数据,冷静下来看全局规律更重要。创业者做战略判断时,真正值得关注的始终是那5到10个核心变量:数据从哪来、成本降得多快、客户换不换、生态粘不粘。其余边际研究,过了临界点价值便快速衰减。

还要学会在不同层次之间切换视角。站在技术细节层,Atlas的几何漂移和纹理闪烁依然存在;站在产业格局层,它已经重新定义了三维内容生产的成本基准。创业者最怕在战术层焦虑细节,在战略层放弃思考。低头盯住进度的同时,定期回到大图景问自己:如果这个方向要被重构,我应该站在哪一层。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。 如需修改或发布文章,请加微信号:sheisceo

阅读量:1547
阅读时间:3分钟