李飞飞发布全球首个多模态世界模型Atlas:几张照片,生成一个3D世界

来源:互联网 时间:2026-09-03

9月2日,“AI教母”李飞飞旗下创企World Labs扔下了一颗技术炸弹——全球首个多模态世界模型Atlas。

Atlas不再满足于生成图片、文字,而是可生成具有像素级精确的图像和视频帧,并将其重建为3D世界。它的核心能力是让AI真正理解3D世界的物理法则和几何结构,而不仅仅是生成看起来合理的2D画面。

它能做什么?

最震撼的功能是:只需1到6张图片,就能生成最长1分钟的1440p视频。它还能处理普通手机拍摄的视频,组成一套多视角拍摄系统;可根据文本描述生成图像及360°全景图。有媒体形容它“能‘暂停时间’”——用几张照片就能重建出完整的空间场景。

底层逻辑完全不同。

此前的AI模型,不管是ChatGPT还是Midjourney,本质上都是“文本上下文”——你给一段文字,它生成一段文字或一张图。而Atlas的核心创新在于用“空间上下文”(Spatial Context)替换“文本上下文”。它把图像、视频、3D深度等信息整合为共享的空间上下文,在三维空间保持场景一致性,还能推演视野之外的环境信息。

目标是让AI真正理解物理世界。

Atlas的终极目标不是做“更炫的视频生成”,而是服务具身智能——它可以把真实场景转为机器人仿真训练环境。换句话说,Atlas正在为机器人打造一个“虚拟训练场”,让机器人在虚拟世界里学会理解真实世界的空间和物理规则。

李飞飞这次“掀桌”,掀的是整个AI的认知范式。 从“文本世界”到“空间世界”,AI正在从“会说话”走向“会看世界”。

相关文章

标签:

A5创业网 版权所有