李飞飞刚发Atlas,中国开源“同款”已抢跑半年?

  henry 发自凹非寺

  量子位 | 公众号 QbitAI

  20 多年前,计算神经学家杰夫·霍金斯写道:“智能不只是模式识别,更是对世界的建模。”如今,世界模型正在批量迎来自己的里程碑时刻。

  9 月 2 日,由 AI 教母李飞飞创办的 World Labs 发布全球首个多模态世界模型(omni world model)——Atlas

  Atlas 最核心的能力,是把文字、图像、视频和 3D 信息放进统一的空间上下文,让模型不只是生成一张看起来合理的二维画面,还能在三维空间中理解并维持场景结构。

  只需一张或几张图片,它就能重建三维场景、生成新的观察视角,并让相机沿指定轨迹在其中移动,同时保持空间结构的一致性。

  鉴于震撼的视觉冲击与生成画面的一致性,Atlas 一经发布便好评如潮。

  不少网友将其视为空间智能的一次重要突破,就连李飞飞本人也将这一时刻称为“里程碑”。

  有意思的是,早在今年 3 月,国内空间智能团队影溯开源的世界模型InSpatio-World也具备着类似能力。据影溯透露,该模型的升级版本也即将发布,并一如既往地开源。

  只消输入一段普通视频,InSpatio-World 会尝试从这些有限的时空观测中,构建一个可以继续探索的动态 4D 场景。

  和 Atlas 类似,它也允许用户改变原始相机轨迹,绕到此前没有拍摄过的位置观察场景;

  不过,与之不同的是,在 InSpatio-World 这里,时间本身也成为了模型需要显式处理的维度。

  用户可以在已有事件范围内改变观察时刻,并从新的视角重新观察同一段动态过程。

  换句话说,Atlas 和 InSpatio-World 虽然技术路径和能力侧重不尽相同,但都指向了同一种变化:

  世界模型正在从“生成一段看起来合理的视频”,走向“围绕一个持续存在的空间或时空状态,生成不同位置、不同视角下的观测结果”。

  前者从图像出发,把相机位置变成访问空间世界的坐标;后者从视频出发,进一步把时间也纳入对动态世界的建模与探索之中。

  如果非要打个比方,Atlas 更像搭建了一座可以随意选择机位的 AI 虚拟片场,把世界造得更完整;InSpatio-World 则想把一段现实录像,高效地变成一个可驱动的世界,能批量给物理 AI 当陪练。

  而这两条世界模型技术路线在当下的相汇,也让我们把目光放到了这家此前颇为低调的国内空间智能公司,影溯身上。

  登顶世界模型权威榜单

  要说影溯最近最出圈的事件,当属登顶世界模型权威榜单 WorldArena 2.0。

  截至 8 月 27 日,在 WorldArena 2.0 首版阶段性公开榜单中,影溯的世界模型 InSpatio-Curious 以 66.11 分位列 77 个参评模型第一。

  除了 Track 1 总分第一,它还在 Physics Adherence、Trajectory Accuracy、JEPA Similarity 和 Depth Accuracy 四项指标及维度上排名第一。

  具体来看,InSpatio-Curious 在 Trajectory Accuracy 上拿到 64.89 分,领先第二名 3.02 分;Depth Accuracy 则达到 99.29 分。

  这两项指标说明,相较榜单中的其他模型,InSpatio-Curious 在生成过程中能够更准确地保持物体运动轨迹与三维空间关系。

  在衡量时空表征一致性的 JEPA Similarity 上,它的得分达到 98.36 分,意味着模型生成结果在时空特征层面与真实世界高度接近;综合考察交互质量与轨迹准确性的 Physics Adherence 指标,则以 73.24 分位居榜首。

  值得注意的是,InSpatio-Curious 的 Image Quality 只有 60.64 分,比综合排名第二的模型低了近 9 分,最后却依然拿下总分第一。

  这说明,这个榜一不是靠把画面磨得更漂亮刷出来的,而是被轨迹、深度、时空表征和交互一致性这些更底层的能力直接抬了上去。

  不过,要理解影溯这次成绩的含金量,还得先看看 WorldArena 究竟在测什么。

  作为清华、上交、港大等高校联合发起的具身世界模型权威评测,WorldArena 是目前衡量具身世界模型真实可用性的代表性评测之一。

  迄今为止,WorldArena 已经迭代至 2.0 版本。简单来说,相比只关注视频生成效果的传统测试,WorldArena 2.0 更像是一个专门为具身世界模型准备的“机器人考场”。

  它不只看画面清不清晰,还会检查机械臂的运动轨迹是否准确、场景中的深度与空间关系是否稳定,以及物体受到作用之后,是否能够按照合理的物理逻辑继续运动。

  毕竟,对于具身智能来说,视频生成得再清晰,如果运动轨迹不准、空间关系错乱,甚至连基本物理规律都无法遵守,那么这样的世界模型也很难真正用于机器人的训练与决策。

  因此,影溯能够在这样一张更强调真实可用性的榜单上登顶,实力可见一斑。

  不过,虽然 WorldArena 2.0 已经比上一版本前进了一大步,但现有评测仍主要围绕标准化仿真环境和机器人操作任务展开。

  相比真实世界,它对场景、物体、动态过程和交互方式的覆盖依然有限,更不用说工厂、家庭、城市和户外环境中层出不穷的长尾情况。

  与此同时,InSpatio-Curious 所在的 Track 1,总分仍主要来自 15 项生成与视觉代理指标。它可以判断一次碰撞在视觉和运动上“看起来合不合理”,却不会直接测量真实世界中的力、摩擦、质量和惯性。

  说白了,模型在一套固定题库里拿到高分,并不代表换一个场景、换一种机器人,或者碰上从未见过的物体时,还能继续稳定答题。

  客观来讲,这并不影响 WorldArena 2.0 在现阶段作为评测工具的诊断价值,但这也同时意味着,它目前证明的更多是模型在特定任务和数据分布下的能力,还不是通用空间智能的“毕业证”。

  也正是在这样的背景下,影溯把目光投向了更上游。

  空间智能,也需要自己的“ImageNet 时刻”

  8 月 29 日,在武汉举行的第二届中国空间智能大会上,影溯联合 20 余家高校团队和行业机构,共同启动了大规模空间智能 3D 数据开放计划 SIDO

  SIDO 想做的事情并不复杂,就是把生产数据的人、训练模型的人,以及真正使用这些数据的人拉到一张桌子上。

  目前,参与方已经覆盖高校、激光雷达、机器人、3D 生成、数字空间以及产业应用等多个环节。

  有人负责把真实世界转化为空间数据,有人负责训练模型,也有人负责把模型放进真实任务中检验,最终打通从数据生产、模型训练到应用反馈的完整链路。

  而这背后真正要解决的,是空间智能长期以来缺少统一、大规模、高质量数据底座的问题。

  未来两年,SIDO 计划逐步建设百万级 3D/4D 场景数据底座,并同步推进评测基准(Benchmark)建设,围绕 3D 重建与生成、场景理解、空间推理、动态预测和具身规划等任务,建立更统一的任务定义与评价标准。

  模型负责学习世界,数据负责提供足够丰富的世界,Benchmark 则负责判断它究竟学会了多少。

  可以说,当模型开始触及现有数据和评测体系的边界,下一阶段的竞争就不再只是怎样把算法做得更好,还包括怎样把数据、任务和评价标准一起向前推进。