BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月02日

注册 / 登录

李飞飞发布Atlas:不向公众开放,先给机器人造数据

美西时间9月1日、北京时间9月2日,李飞飞创办的World Labs在官方博客发布新一代世界模型Atlas。与2025年11月直接对所有人开放的上代产品Marble不同,官方称这个新一代模型目前只进入早期访问、面向部分合作伙伴:页面上只有一个申请表单,没点名任何合作方,也没有API和定价。

官方给出的演示口径却不保守。输入1到6张图片,配上手工设计的相机路径,最长可输出1分钟、1440p分辨率的视频,并强调“像素级相机控制”;把2到25张地面照片放进去,斯坦福主方庭就能被重建成可以从空中飞越的三维场景。

一家把“生成三维世界”当生意的公司,为什么在更强的模型上主动把门关上?答案藏在它反复强调的另一个用途里:给机器人造数据。

“全球首个”是媒体标签,官方自己的说法不同

围绕Atlas的传播里,最抢眼的是“全球首个多模态世界模型”这一表述,财联社9月2日以此为题把它放上头条。但对照原始来源,这个定语立不住:官方博客标题是“Atlas: A World Model for Spatial Intelligence”,正文称其为“我们的新一代全模态世界模型(new omni world model)”,作者落款是World Labs团队,通篇没有“首个多模态世界模型”之类的说法。更直接的反证在公司自己的时间线上——2025年11月Marble那篇博客的标题就叫“Marble: A Multimodal World Model”,正文称其为“frontier multimodal world model”。

所以“首个”属于转述标签,既不是厂商宣称,更不是第三方认证。真正能立住的技术表述是另外一句:Atlas同时输出像素和显式三维结构。官方描述,重建任务的输出既包括新视角下的图像帧,也包括点云或3D高斯泼溅(一种把场景表示为大量带颜色参数的三维点的表示方法,可以被程序直接读取);它的输入也不只是图片,还包括每张图绑定的相机位姿和深度图——官方把这套把图像、视频与三维统一编码的机制称为“空间上下文(Spatial Context)”,模型本体则是一个多模态自回归扩散Transformer,从文本、图像、视频和3D数据上从零预训练。

这一步的区分度不在“画面更像真的”,而在输出物能否被下游程序接着用。视频生成模型的产物是给人看的,Atlas声称自己交出的东西可以被导入仿真器、参与计算、被机器读取。

四个能力,加一个更值得盯的第五个

官方博客把Atlas的能力列成四类:像素级相机控制的新视角视频生成;从1张到上百张图的稀疏视角三维重建(官方称通常2到3张即可较忠实重建);用3到5个手机机位的素材重拍“子弹时间”镜头;以及文本生成图像与360度全景。官方还称,为机器人场景重建环境时,每个环境只用了手机视频里的24帧画面。

第五类能力只出现在一小段话里,却是这家公司真正的意图:官方称,“当仿真的机器人在空间中移动时,Atlas同时会生成它的传感器本应看到的RGB图像和深度数据”。也就是说,模型不只造场景,还顺手把机器人“眼睛”要用的那批观测数据一并生成出来。

这条线索早就埋下。7月28日的官方博客《Building Worlds That Train Robots》中,公司写下过一句更直白的话:与训练语言模型所用的互联网数据不同,“机器人的经验采集昂贵且难以控制”,具身智能的关键瓶颈“不只是架构,而是大规模的经验与评测”。该文的方案是把一个真实任务重建进仿真,再批量改变外观、物体配置、杂乱程度、物理参数、机器人初始状态和相机视角,官方对此的口号是“一个真实任务,上千个变体”。

机器人最贵的不是算法,是“经验”

那篇博客披露了World Labs自己的评测协议:每个模型检查点跑2000次仿真试验(1000次分布内、1000次分布外),外加100次真机试验;在笔、马克笔等抓取任务上,使用RB-Y1、YAM、Flexiv、xArm等机器人平台“自主运行一小时无干预”,而策略训练阶段用的是“零真实世界训练数据”。

需要强调,以上全部是厂商自述,没有第三方复现,也没有给出成功率百分比。但组织与资本层面的动作可查:7月21日,机器人与仿真公司SceniX并入World Labs(博客标题使用“Acquires”,正文只写“joined”,金额与条件均未披露);2月18日,官方博客称公司已获得10亿美元新融资,列出的投资方包括NVIDIA、AMD、Autodesk、Fidelity、Sea等,但未披露估值。给世界模型出钱的,同时是卖算力和机器人仿真工具链的那批公司。

这条赛道也没有独家秘密。英伟达官网对Cosmos 3的定位是“开放的物理AI基础模型”,明确写着“把视频生成当作想象来训练物理AI,从而不受真实拍摄内容的限制”,并把模型权重开源在Hugging Face上。分歧在于路线:英伟达走开源权重加工具链、把生态留在自家GPU上;World Labs走闭源模型加自有产品分发(Marble、1月21日上线的World API);谷歌的Genie系列更偏向可交互世界生成。Atlas在其中的差异点,仍是它把“像素+显式三维+传感器数据”绑在同一个模型里输出。

它现在还不能证明什么

第一,效果没有独立验证。官方关于“优于近期视频模型”“优于最好的专用开源重建模型”的结论,来自第三方人工评测者打分,基准表以图像形式呈现,可读正文里没有数据集名称与具体误差数值。国内报道中被引用的“DTU数据集25.3‰重建误差”,在官方博客正文中找不到对应数值和单位口径,只能存疑。官方自己也承认,“没有单一基准能完整刻画它的通用性”。

第二,输入越少,模型补得越多。官方在演示中承认,单张图片案例里“其余场景是被想象出来的”,并写下“它看到得越多,想象得就越少”。对做影视的人来说这是优点,对做训练环境的人来说这是风险——没拍到的区域属于模型推断,这些区域能不能拿来训机器人,取决于几何与物理误差能否被量化。长路径生成还可能出现几何漂移与纹理闪烁。

第三,商业入口还没打开。未点名合作伙伴、没有API、没有定价、没有公开上线时间。参照公司自身节奏,Marble从研究预览到全面开放大约用了两个月,而Atlas的官方表述是它将“驱动未来版本的Marble”。

因此更准确的判断是:Atlas在内容生成端的价值是可见的效率提升,在具身智能端的价值目前只是一个自洽的技术方案。假如后一条路被验证,成本结构最先被撬动的不是机器人本体制造,而是手工搭建仿真环境、外包数据采集和遥操作示教这条链。反过来讲,机器人能力的提升也不取决于有没有一个逼真的虚拟世界,力控、本体可靠性和真实部署数据仍是硬约束。

接下来值得盯的是四个信号:会不会公布可复现的定量基准(重建误差、位姿误差、长程一致性);早期访问名单里有没有具名的机器人或自动驾驶客户;是否接入World API并公开定价与推理成本(RTFM当年的口径是单张H100实时生成,可作为算力成本参照);以及,会不会有人公布sim-to-real的迁移成功率。

一个只向少数伙伴开放的模型,至少说明厂商自己判断它还没到“给人用”的阶段——但它显然已经在准备“给机器用”。

参考数据来源

  1. World Labs · Atlas: A World Model for Spatial Intelligence · 2026年9月1日 · https://www.worldlabs.ai/blog/atlas
  2. World Labs · Building Worlds That Train Robots(Real-to-Sim-to-Real) · 2026年7月28日 · https://www.worldlabs.ai/blog/real-to-sim-to-real
  3. 财联社·科创板日报 · AI教母披露“里程碑式”成果!全球首个多模态世界模型来了 · 2026年9月2日 · https://www.cls.cn/detail/2471956


版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。