①德意志银行指出,AI时代光网络业务硬件公司有望成为最大赢家,将Coherent、Lumentum列为最有信心的投资标的;
②该行给予Lumentum、Coherent等5只硬件股买入评级,戴尔科技等3只为持有评级。
《科创板日报》9月2日讯(编辑 宋子乔) 科幻寓言《平面国》中,主角生活在2D的平面世界,后被3D球体带入空间国,才知晓高度的存在。如今,AI也有望迎来类似的顿悟时刻。
9月2日,“AI教母”李飞飞旗下创企World Labs发布了“全球首个多模态世界模型”——Atlas,该模型不再满足于生成图片、文字,而是可生成具有像素级精确的图像和视频帧,并将其重建为3D世界。

Atlas的核心能力围绕“理解与模拟3D世界”展开,旨在让AI真正理解3D世界的物理法则和几何结构,而不仅仅是生成看起来合理的2D画面,底层创新在于用“空间上下文”(Spatial Context)替换“文本上下文”。
不同于大模型处理文本上下文,Atlas采用多模态自回归扩散Transformer架构,将输入的每一张图片和视频都锚定在三维空间中的一个精确位置,并附有相应的相机位姿和深度信息。这相当于给模型提供了一个带有“坐标轴”和“比例尺”的三维草稿本,让AI在理解世界时有了明确的几何和物理参考。

据World Labs官方介绍,其从头开始对Atlas进行预训练,使其能够接受多模态输入,并将其转化为3D视图。Atlas展现出的关键能力包括:
像素级相机控制:只需1到6张图片,就能生成最长1分钟的1440p视频。更重要的是,用户可以像真正的导演一样,精确规划相机的运动轨迹,让AI生成连续、一致的新画面。

“少即是多”的空间重建:传统3D重建需要成百上千张照片,而Atlas在稀疏视角下表现卓越。在DTU等公开数据集测试中,其重建误差(25.3‰)优于多个专用模型。在一个案例中,它仅凭2到25张地面拍摄的照片,就重建了斯坦福大学的整个主方庭,并生成了高空俯瞰的飞行路径。

“子弹时间”与时空模拟:Atlas能处理普通手机拍摄的视频,组成一套多视角拍摄系统,创造出《黑客帝国》般的“子弹时间”特效,让时间“冻结”并转换视角。

图像生成:Atlas可根据文本描述生成图像及360°全景图,不仅能遵循复杂指令,精准呈现文字,还能驾驭丰富多样的视觉风格。


Atlas更深远的意义,在于打通那条通往“具身智能”的路。该模型被李飞飞本人视为其团队的一个“里程碑式”成果,“这是迄今为止最优秀的相机控制世界模型,为从视觉特效到机器人等众多应用场景打开了大门。”

可以预见,一个用3D视角理解现实世界的AI,能和人类一样看待时间和空间,这将推动多个物理AI场景落地。
视觉特效与内容创作:创作者可以像导演一样精准地控制AI生成视频的每一个镜头,极大地降低了复杂运镜和难度特效的制作成本和门槛。


机器人预训练:这是Atlas意义最深远的一个应用。它解决了机器人训练中“真实数据匮乏”的难题。通过少量真实照片,Atlas就能生成一个逼真的三维模拟环境以及机器人传感器会观察到的RGB和深度数据,让机器人在仿真世界里进行海量训练,再迁移到现实世界,效率将得到质的飞跃。


3D内容生成:改变了3D场景的构建方式。以往需要昂贵设备扫描的场景,未来或许仅凭几张随手拍摄的照片就能在电脑里重建,这将为游戏设计、AR/VR等领域带来新的可能性。


不过,值得注意的是,尽管Atlas展现了强大的能力,但它仍存在明显的技术边界,并非成熟的通用世界模拟器。比如它擅长构建几何连贯的静态空间,对于物体碰撞、复杂动力学的通用物理模拟能力仍待验证。当镜头转向完全未拍摄的区域时,模型依然需要进行“想象”,依靠先验知识补全画面,生成的画面可能并非真实世界的精确复刻,随着生成路径变长,也可能出现局部几何漂移或纹理闪烁。
目前,Atlas已进入早期访问阶段,仅向部分合作伙伴开放,未来它将用于驱动World Labs自家的Marble等产品。