刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降

  允中发自凹非寺

  量子位 | 公众号 QbitAI

  9 月 17 日,Figure 把 Helix 2.5 带进了旧金山湾区 30 个陌生家庭。它要收拾散落在客厅里的玩具、叠毛巾、铺床。机器人到达现场后,不再采集新数据,不更新模型权重,也不根据现场执行结果重新选择模型。

  视频很容易被概括成“人形机器人‘零样本’做家务”。严格来说却并非如此。三个任务此前都在其他环境中用专门数据做过适配。Figure 所说的“零样本(zero-shot)”,是指机器人第一次进入这些家庭,面对新的布局和操作对象时,不再针对当地环境和物体重新训练。

  注:Figure Helix 2.5 在 30 个此前未采集任务训练数据的湾区家庭中执行整理客厅、叠毛巾和铺床任务。这里的“零样本”指机器人面对新的家庭环境、空间布局和操作对象实例时无需现场重新训练,并不意味着模型此前未学习过这些任务;相关任务此前已使用其他环境采集的数据完成适配。来源:Figure

  视频之外,Figure 还公布了两组更容易被忽略的实验。

  第一组直接比较是否经过 Index 预训练。

  Figure 用同一批任务专属数据训练了两套策略模型,架构、优化方式、超参数、下游数据和评估方法保持一致。一套随机初始化,另一套从 Index 预训练模型开始。前者在 30 个陌生家庭中的完整任务成功率为9%,后者达到56%

  这个 56% 要求完整完成任务,部分完成任务的情况不得分。以收拾客厅为例,所有玩具都必须进入篮子;如果出于安全原因需要人工干预,整个执行回合直接记为失败。按照 Figure 披露的实验协议,两组模型之间的主要差异是——是否经过 Index 预训练

  另一组实验转向离线评测,专门考察预训练数据规模。

  Figure 用 Index 的四档嵌套数据(nested data)子集训练模型,预训练数据总跨度为 8 倍;模型大小不变,下游训练方式也保持一致。每个模型再使用相同的任务数据进行微调,比较留出测试集上的机器人动作预测损失。

  随着 Index 数据规模翻倍,损失规律下降。Figure 还用较小规模实验拟合趋势,再预测最大规模模型的测试结果;官方称,预测误差只相当于整个 8 倍数据范围内损失变化的 0.54%。

  这两组实验结果很容易被囫囵理解为“Figure 发现了机器人规模定律(Scaling Law)”,但它们本质上是对不同问题的回答。

  第一组实验中的9% 到 56% 说明,有没有大规模的人类行为预训练,会显著影响机器人在陌生环境中的闭环泛化。

  第二组中的四档数据的损失曲线说明,当人类数据预训练规模继续扩大后,这种收益在下游机器人动作预测上呈现出可测量的随规模变化的曲线。

  Figure 目前没有公布 1 倍、2 倍、4 倍、8 倍 Index 预训练分别对应多少真实家庭成功率。也就是说,预训练规模持续扩大,对闭环机器人表现会产生怎样的连续变化,这条曲线还没有公开

  上:Figure 在真实机器人闭环评测中,对比了未经 Index 预训练与经过 Index 预训练的模型。在其公开的多项未见任务中,Index 预训练模型的成功率均明显更高;Figure 在正文中将总体结果概括为完整任务成功率从9% 提升至 56%。这组实验回答的是:“有没有大规模人类行为预训练,会不会影响真实机器人执行结果?”

  下:Figure 进一步使用 4 档严格嵌套的 Index 数据,将预训练规模从 1 倍扩大到 8 倍,并在模型规模、下游训练和评估流程保持一致的情况下,观察到适配后的机器人动作预测验证损失持续下降。这组实验回答的是:“当人类数据预训练规模继续扩大,离线迁移指标是否呈现可预测的规模效应?”

  两组实验并非同一条曲线。Figure 目前尚未公开 1 倍、2 倍、4 倍、8 倍 Index 预训练规模分别对应的真实机器人闭环成功率,因此不能据此推导“预训练规模扩大后,真实任务成功率按相同规律连续提升”。

  恰恰是这里,让 2026 年的机器人预训练出现了一个比“Human Data 有没有用”更具体的问题:

  人类经验能不能像文本之于大模型那样,成为机器人预训练中一种可以持续扩展、并能预测下游收益的数据来源?

  Dyna:人类数据的规模效应已经进入真机闭环

  Figure 并不是第一个观察到“人类数据越多,机器人越受益”的团队。

  8 月,Dyna Robotics 发布 Dyna-2。它把第一视角人类视频构成 1000 小时、1 万小时、10 万小时和 100 万小时四个严格嵌套的数据规模。更大的数据集只是在较小集合上继续增加数据,而且各来源比例保持一致,尽量排除数据分布变化对结果的干扰。

  随后,Dyna 把四档模型用同一套机器人后训练方法适配到 14 个真实机器人任务。四档模型的平均归一化得分,依次达到任务可达上限的 20%、28%、45% 和 53%。也就是说,人类视频预训练时的规模差异,经过同样的机器人后训练以后,最终延伸到了真机闭环表现。

  注:Dyna 分别使用 1000 小时、1 万小时、10 万小时和 100 万小时第一视角人类视频进行预训练,再将四档模型用相同的机器人后训练方案适配到 14 个真实机器人任务。随着人类视频预训练规模扩大,14 项任务的平均归一化表现依次达到任务可达上限的 20%、28%、45% 和 53%,说明预训练阶段的规模差异在经过相同机器人后训练后,仍然延伸到了真实机器人闭环表现。这里的 20%—53% 是 Dyna 为了汇总不同任务原生指标而定义的平均归一化表现,并非任务成功率,也不能与 Figure 在 30 个陌生家庭中报告的 56% 完整任务成功率直接比较。

  因此,更准确的技术时间线不是“Figure 第一次发现人类到机器人的规模定律”。Dyna 此前已经展示了更完整的跨本体、从预训练规模一路延伸到闭环真机表现的证据;Figure 则把可预测的迁移规模效应明确延伸到了全身人形机器人系统上,并用 30 个陌生家庭让人类预训练的现实价值变得更加直观。

  百万小时之外,Dyna 还通过一组消融实验追问:这种规模效应究竟从哪里来?

  单独预测动作时,模型随着数据增加出现严重而不稳定的过拟合。加入未来视频预测以后,39 个机器人任务上的迁移表现整体改善;而当研究者进一步增加不带动作标签、只用于视频预测的人类视频时,跨本体表现才随着数据规模呈现出稳定的单调提升。

  因此,单纯说“扩大人类数据规模就会持续获益”,仍然不够准确。

  数据是什么,以及模型被要求从中学什么,共同决定了规模效应会不会出现。

  一旦人类经验开始成为机器人预训练资产,追问自然就落到了数据来源本身:这些经验应该从哪里来?

  Figure:建立一套可控的人类数据供应链

  Figure 在 Index 发布稿中把自己的判断写得很直白:

  “要规模化训练真正通用的机器人,所需要的数据并不存在于来源广泛的互联网视频。”

  于是它搭建了一套自己的 Human Data 供应链。

  Index 通过 Creator 创作者网络,让人们在真实家庭和工作场所记录任务。到 8 月底,Figure 称平台已经收到超过 1600 万条视频,并累计向创作者支付 1500 万美元;Helix 2.5 发布时,新的人类视频数据正以约 35 分钟/秒的速度进入 Index。数据随后还要经过质量过滤、反作弊、去重、重新平衡和文本标注。

  △Figure Index 的数据处理流程,来源:Figure Index

  注:Figure 将 Creator 贡献者上传的真实世界视频依次经过质量过滤与标注、反作弊审查、去重和数据再平衡,最终形成用于训练 Helix 的数据集。与直接使用互联网公开视频不同,Index 代表的是一条“主动建设人类行为数据基础设施”的路线:通过持续采集、筛选和整理,更系统地获得适合 Physical AI 训练的大规模 Human Experience。

  算力也在同步扩张。

  9 月初,Figure 宣布与英国 AI 云厂商 Nscale 达成战略合作。该合作涉及一份初始价值 35 亿美元的算力承诺,未来合作规模或将扩大至 60 亿美元以上;双方计划基于英伟达 Vera Rubin 平台部署最高 10 万颗 GPU。Figure 创始人兼 CEO Brett Adcock 直言不讳,Helix 下一阶段越来越受制于数据和算力。

  这是一条资本密集,但对数据分布拥有更强控制力的路线。

  某类任务不够,可以定向补;某种环境过多,可以重新平衡;长尾里缺什么,就继续组织人在现实世界里生产。

  Index 不只是一个不断扩大的数据集,更像是一套可以主动改变训练数据分布的基础设施

  但 Figure 目前尚未在 Helix 2.5 相关材料中披露 Index 全量数据统一的拍摄视角构成,也没有公开完整的人类动作监督机制。现在能够确认的是,它正在以极大的规模采集、筛选和组织真实人类行为数据,而 Index 预训练已经显著改善了 Figure 自己的完整人形机器人系统。

  Figure 的解法,是通过专门采集和数据治理,主动塑造自己需要的训练分布。

  行业同时在尝试另一种办法:不重新生产全部数据,而是提高模型从互联网公开视频中提取可迁移信号的能力

  另一条路线:让模型理解互联网中的人类经验

  互联网公开视频不是天然的机器人数据(Robot Data)。

  视频中的镜头位置多样,人体会被遮挡,动作也没有关节控制标签,更没有机器人的本体感知、力反馈和接触状态。视频里一个人伸出手打开橱柜的几十帧,距离一台人形机器人真正需要输出的控制信号还很远。

  另外一些团队没有像 Figure 那样采集更多专门为机器人而生的数据,而是尝试通过模型学习和表示转换,从已有视频中提取可迁移信息。

  CoMo 从互联网视频中学习连续的潜在运动表示,并为此前没见过的视频生成伪动作(pseudo-action),再与有限的机器人数据共同训练策略模型。“互联网视频能否转成与动作相关的监督信号”,并不是一个全新的命题。

  HuRo 做得更直接。它把来源和视角各异的人类视频 “机器人化”,转化成更接近机器人观察和动作分布的数据;随着这类预训练数据扩大,真实操作任务的完成度和分布外(OOD)表现继续改善。

  Rhoda 则绕开了显式的人类动作。它用来源广泛的互联网视频训练因果视频模型,让模型先预测世界接下来如何变化,再通过逆动力学模型把这种预测转换成机器人动作。近期的真实工业任务实验显示,更大的预训练模型和更多训练算力都能改善机器人策略,而且当机器人数据较少时,更强预训练带来的收益更明显。

  这些方法虽然机制不同,却都在检验另一种可能:当原始数据离机器人分布较远时,能否通过表示学习(representation learning)、动作恢复或世界建模来弥补其中的差距。

  互联网视频的确没有现成的机器人动作轨迹。但其中的人类行为、物体交互和物理世界规律,究竟有多少能够被重新编码成物理 AI 真正能用的经验,仍然没有定论。

  亮源新创(Light Origins)则大胆地把问题又往前推了一步:数据源直接来自普遍存在的互联网人类行为视频

  亮源新创:把预训练数据源推向互联网规模

  亮源新创选择的不是专门为机器人训练采集的数据,也不是主要依赖第一人称人类视频,而是尝试从互联网中的第三视角人类行为视频中提取可迁移经验

  互联网上已经积累了海量人类行为视频。这类数据更容易实现规模化和多样性,代价则是更大的人机域差异(domain gap):镜头并不跟随视频中的人类身体,动作可能被遮挡或剪辑,人类和机器人身体结构不同,视频里没有可以直接执行的动作标签。

  根据 9 月 21 日亮源新创官网正式发布的技术博客来看,Light-O1 先从视频中恢复结构化人类动作,再编码成统一的人形动作表示,与视觉、语言信息一起进行自回归预训练,最终得到一个人类动作先验(Human Action Prior)

  △来源:据亮源新创技术报告整理制作

  注:从机器人遥操作、UMI 等机器人数据,到第一视角人类视频,再到互联网规模的第三视角人类行为视频,数据来源覆盖范围逐步扩大,同时也伴随着视角、本体和动作表示差异的增加。本图用于说明亮源新创选择的人类动作预训练数据来源位置,不代表不同数据来源之间的性能比较。

  此次技术博客披露的人类动作预训练规模,从 37.5 亿扩展到 1200 亿词元(token),最大规模约对应 10 万小时人类动作。

  Light-O1 分别在第一视角人类数据、公开机器人数据和亮源新创自研人形机器人数据上进行目标域适配。随着人类动作预训练规模扩大,适配后的动作预测误差、全身姿态误差和腕部位置误差均持续下降,并呈幂律趋势。亮源新创将这一现象称为“迁移缩放定律”(Transfer Scaling Law)

  △Light-O1 展示人类动作预训练规模与跨本体预测误差之间的缩放关

  注:亮源新创将人类动作预训练规模从 37.5 亿 tokens 扩展至 1200 亿 tokens,并在第一视角人类数据、Unitree G1 机器人以及亮源自研人形机器人数据等目标域上进行评估。实验显示,随着预训练规模扩大,动作预测误差和身体姿态预测误差在不同目标域上持续下降,呈现幂律缩放趋势。该结果基于目标域适配后的预测指标,用于衡量预训练规模与迁移效果之间的关系,并不等同于真实机器人闭环任务成功率。

  人类动作先验并不是亮源新创首创;从公开的互联网视频中提取与动作相关的信号,也已经有 CoMo、HuRo 等近邻工作。

  Light-O1 这次更值得关注的,并不是“用了互联网视频”本身,而是把几件此前通常分开研究的问题放进了同一组规模实验:互联网规模的人类动作视频、结构化动作恢复、持续扩大的预训练规模,以及这些规模收益在不同机器人和人形机器人目标域适配后仍然保留下来。

  至此,亮源新创首次验证了互联网规模的人类动作预训练对多本体人形机器人的迁移缩放定律

  注:视频展示 Light-O1 当前模型在机器人平台上的任务执行能力,用于说明预训练和后续适配后的模型具备真实可执行行为。本文讨论的“迁移缩放定律”仍以留出数据上的开环评测为依据。来源:亮源新创

  更值得追踪的是:如果模型真的能从距离机器人更远的数据里持续获得可迁移的动作先验,这条“Scaling”(规模效应)之路最终能走到闭环真机的哪一步?

  从离线迁移到闭环表现,不同“规模效应”不是一回事

  当把 Figure、Dyna 和亮源新创放在一起,很容易把不同层级的“Scaling”混为一谈。

  注:不同团队正在探索 Human Experience 如何转化为机器人能力。目前公开研究已经分别展示了从人类经验规模化、跨本体迁移、真实机器人闭环表现等不同层面的证据。由于不同研究采用的数据、模型和评测协议不同,本图用于展示公开证据所在层级,不代表企业能力排名或横向比较。制图:原文作者

  最基础的一层,是预训练本身能不能随着数据增加持续改善。

  再往下一层,是这种改善离开人类数据域以后,能不能在机器人或人形机器人目标域中继续存在。

  Figure 的四档 Index 实验和亮源当前的核心结果,主要落在这里:更大规模的人类预训练,对应更好的下游机器人动作相关离线指标。

  然后才进入真实机器人的闭环表现。

  Figure 用 Index 预训练和随机初始化的9% 对 56%,证明“有没有预训练”会显著改变机器人在陌生家庭里的实际执行结果;但它尚未公开 Index 规模每翻倍、闭环成功率如何连续变化。

  Dyna 则已经用四档人类视频预训练,在相同机器人后训练条件下得到 20%、28%、45%、53% 的平均归一化闭环得分。两套数字定义完全不同,不能横向比较。

  再往下一步,才是最接近产业经济的问题:

  达到相同能力时,更强的预训练究竟能少用多少新的机器人真实经验?

  Figure 给出了一个值得关注的信号:Helix 2.5 在一个同任务比较中,只使用此前 Helix 02 约一半的任务专属数据,就达到相近成功水平,同时把部署范围扩展到了 30 个陌生家庭。

  但这组比较跨了模型代际和评估条件,并不是严格控制的等性能实验,因此不能直接推导“Index 普遍把机器人数据需求减半”。

  Dyna 用大约 10 分钟机器人示范就完成 Bottle Cap Untwisting 的实验同样有吸引力,而且表现随着人类视频预训练规模继续提升;但它依然不是一条可以直接换算“多少小时人类数据等于多少小时机器人数据”的曲线。

  就目前公开证据而言,亮源新创验证到的仍主要是适配后的离线迁移。

  因此,它下一步最有信息量的实验其实很明确:固定机器人适配方案,让不同人类动作预训练规模的模型逐一进入闭环;再改变机器人数据预算,看能否形成等性能曲线。

  到那一步,才有条件真正讨论“互联网级人类动作”的数据经济性。

  计算最终着眼处:整条数据成本链

  机器人行业习惯用“小时数”描述数据规模。

  一小时遥操作数据多少钱,一小时 Human Video 多少钱,现有的互联网视频则几乎不需要重新去采。按照这种算法,Figure 看起来昂贵,互联网原生路线似乎天然便宜。

  实际账本远没有这么简单。

  Figure 愿意为 Creator 创作者、采集体系、质量控制和主动数据再平衡付钱,换来的是更可控的数据分布:缺什么,就能继续生产什么。35 亿美元级别的算力合作,则继续把这套数据基础设施推向更大的模型。

  从互联网公开视频出发,确实省掉了重新让人执行一次任务的物理采集成本。

  新的账单会出现在别处:哪些视频值得留下,人体动作能恢复到什么精度,镜头运动和遮挡如何处理,怎样把人类动作转成机器人可用的表示,以及需要多少训练算力,才能把这些嘈杂经验真正压进模型。

  Dyna 提供了第三种可能:并非所有视频都必须恢复出高质量动作标签,世界建模本身也可以让大量只有视觉经验的视频参与规模化学习。

  所以,这场数据战未必会以“谁拥有更多视频”决胜,更不能只比较两种路线的原始采集成本。

  真正要算的是整条链路。

  从得到一段经验,到它最终变成机器人可以迁移、可以执行的能力,需要支付的不只有采集成本,还有表示、对齐、算力,以及最后仍然难以完全省掉的真实机器人经验。

  Helix 2.5 让人类经验成为一条更难忽视的规模化轴线;Dyna 已经证明,这条轴有机会一路穿到真实机器人闭环;亮源新创则把实验继续推向距离机器人数据分布更远但却最为丰富的互联网级人类行为

  接下来值得比较的,也许不再只是哪个公司拥有最多“小时数”。

  而是机器人获得下一项能力时,整条链路还要向真实世界支付多少成本。

  *本文系量子位获授权刊载,观点仅为原作者所有。