自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

  Zeva 团队投稿

  量子位 | 公众号 QbitAI

  模型不更新,能力却持续增长。

  这是 Zeva 最反直觉的地方,也是清华 AIR 域变换联手给出的新答案。

  在多个典型具身基准任务上,将冻结模型的累计成功率从 26% 提升到 73%;在真实化学实验室,机械臂在多次尝试中越用越稳。

  更关键的是,一次人类演示就能让模型“学会”一个新操作。

  Zeva首个实现 In-Context Causal Learning(ICCL)的具身 WAM

  它让模型可以在不更新权重的情况下,从自己的交互经验中持续学习。当这种能力逐步成熟,具身智能将迎来属于自己的“GPT 时刻”。

  项目信息

  项目名称:Zeva

  发布机构:清华 AIR、域变换

  论文题目:Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation

  项目主页:https://air-embodied-brain.github.io/Zeva/

  具身模型的自进化,为什么过去很难?

  具身智能的真正瓶颈,是“模型到了现场能不能越做越好”。

  传统思路里,想让机器人适应新环境,通常要重新采集数据、微调模型或做 test-time training。

  但这些方法依赖梯度更新,速度慢、成本高,还可能在适应新任务时破坏已有能力。

  另一类 in-context learning 方法可以让模型根据演示或任务描述调整行为,但主要解决“任务理解”,并没有让模型从自己的动作后果中学习物理因果。

  从“任务泛化”到“因果迁移”

  过去我们谈跨域,更多是 sim-to-real、跨本体迁移、跨任务泛化。这些方法大多依赖数据对齐或表征对齐,本质上是在不同域之间搬运“任务经验”。

  Zeva 更进一步:它迁移的是“动作与状态变化之间的因果关系”。

  同一个模型,在仿真里学到的物理因果,可以被带到真实机械臂;在一次尝试里积累的失败经验,可以指导另一个相似物理过程的尝试;人类的一次演示,也可以直接变成机器人的因果上下文。

  这种跨域迁移通过上下文完成。模型在上下文中推断环境因果结构,并把因果知识用于下一次动作生成。这就是 Zeva 所定义的 In-Context Causal Learning。

  示例一:从放置称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。

  示例二:从称取试剂至称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。

  示例三:从一次人类演示中完成上下文内因果学习。

  Zeva:把“因果学习”装进模型上下文

  △Zeva 总体框架。模型通过 Causal Interaction Extraction、Dual-timescale Causal Memory、In-Context Policy Injection,在不更新权重的情况下实现部署中自进化。图片来源:论文

  Zeva 是一个模型。它的 Causal Transition Encoder、Dual-timescale Causal Memory、In-Context Policy Injection,都属于模型推理链路的一部分。

  在每个环境步,Zeva 提取三类信号:视觉状态、动作编码、观察到的状态变化。

  它们被递归编码为 Causal Interaction State,并进一步投影为 Phase Token 和 Causal Interaction Signal。

  这些因果信号被组织成双时标上下文:Brief Interaction Trace 负责当前尝试内的连贯执行,Persistent Interaction Memory 跨尝试累积可复用经验。

  决策时,Zeva 检索与当前任务阶段匹配的交互证据,构造 Causal Prompt,注入冻结的 Cosmos3 动作生成模型。整个过程零梯度更新。

  技术拆解:Zeva 如何“以小博大”

  亮点一:Causal Transition Encoder,让模型看见“动作→结果”。

  模型显式学习动作引起的状态变化。训练目标包括因果效果预测、任务聚类和阶段进度,让 Causal Interaction Signal 真正携带物理因果信息。

  亮点二:双时标因果记忆,让模型可以跨尝试自我进化。

  BIT 保证当前执行的连贯性,PIM 把一次失败、一次修正、一次成功沉淀为后续可检索的上下文。同一个模型在 repeated attempts 中越用越强。

  亮点三:In-Context Policy Injection,让冻结模型直接消费因果上下文。

  通过 Causal Prompt 把任务、阶段和交互证据注入生成模型,不加额外噪声、不参与 flow loss,只作为条件影响后续动作。这是“不调权重也能进化”的关键设计。

  和传统 Test-Time Training 相比,Zeva 的差异很直接:

  数据说话:自进化 +One-Shot 人类演示增强

  在 RoboCasa365-Atomic5 上,Zeva 平均成功率 76.8%,效果最优。

  更重要的是部署后的 self-evolution 曲线:累计成功率从 Evolve 1 的 26% 提升到 Evolve 4 的 73%。

  真实化学实验室 ChemLab-Evo 上,三个原子任务同样呈现单调增长:Pick Up Test Tube 从 65% 到 100%,Place Beaker 从 25% 到 70%,Pour Water 从 30% 到 80%。

  Zeva 还支持 one-shot human demonstration enhancement:一次人类演示初始化 PIM 后,模型无需微调即可复现关键操作。

  量化结果显示,人类 warm-up 在 Place Beaker 上最高带来 20 个百分点的提升,在 Pour Water 上带来 15 个百分点的提升。

  △RoboCasa365 上,Zeva 在模型权重完全冻结的情况下,累计成功率从 Evolve 1 的 26% 提升到 Evolve 4 的 73%。图片来源:论文

  △真实化学实验室中,三个原子任务累计成功率随尝试里程碑提升。模型参数未更新。图片来源:论文

  △One-shot 人类演示 warm-up 对三个原子任务的影响。虚线为有人类演示初始化,实线为纯自进化。图片来源:论文

  为什么 Zeva 是一个新范式?

  Zeva的深层意义,是把具身模型的 scaling 从“参数空间”延伸到“上下文空间”。

  传统 scaling 通过扩大数据、参数、算力来提升模型能力。

  Zeva 展示的另一种 scaling 是:在部署过程中不断增加可供模型消费的因果上下文。

  每一次尝试都会产生新的 interaction evidence,这些证据被压缩为 Causal Interaction Signal 并进入双时标记忆。

  模型每多一次交互,就多一次对当前物理环境的“隐式系统辨识”。

  这里的理论基础是:模型可以把每个新场景的环境属性作为隐变量,在推理时从过去的动作-效果证据中推断出来。

  物体质量、关节约束、接触特性、摩擦条件,都可以通过交互信号被隐式估计。冻结策略因此可以在不改变参数的情况下,不断逼近当前物理系统的真实动态。

  更进一步,Zeva 的 Causal Interaction Signal 是一个效应空间中的紧凑表示,直接编码物理效应信息。

  跨任务 effect retrieval 实验显示,不同物体、视角和任务指令下的等价物理效应,会在该空间中彼此靠近。

  这意味着模型学到的是“这类物理效应如何产生”,同时也覆盖具体任务的做法。这种表示天然支持跨域迁移,也让“域变换”成为一个可计算、可检索、可复用的技术概念。

  如果把 VLA 看作“任务理解与动作生成”的基础设施,世界模型看作“经验想象”的基础设施,那么 Zeva 定义的 ICCL 就是“现场因果学习”的基础设施。

  它把部署从“能力消耗”变成“能力积累”,把每一次失败从噪声变成可检索的因果证据。

  如果 ICCL 成立,具身智能的 scaling 将多出一条独立于参数规模的曲线:交互次数越多,因果上下文越丰富,模型对当前物理域的辨识越准,任务成功率越高。这才是“域变换”作为新范式的真正含义。

  结语

  清华 AIR 与域变换联手发布的 Zeva,重新定义了具身模型的自进化:

  不调权重,也能越用越强;不重新训练,也能从一次人类演示中学会新操作。

  域变换开启的,可能是一条新的 scaling 路径:让机器人在真实物理世界中,自己学会因果,自己完成进化。

  [1]论文:Zeva: In-Context Causal Interaction Memory for Embodied Action Generalization

  [2]项目主页:https://air-embodied-brain.github.io/Zeva/

  关于清华 AIR 与域变换

  清华 AIR(Institute for AI Industry Research, Tsinghua University)是清华大学面向第四次工业革命的国际化、智能化、产业化的研究机构,被视为中国 AI 产学研结合的第一梯队。

  域变换是清华 AIR 面向物理智能自进化时代孵化的公司,由刘云新教授和曹婷教授发起,本次发布的 Zeva 是清华 AIR 在具身智能方向从前沿研究走向产业落地的重要标志。

  刘云新

  清华大学智能产业研究院副院长、博导、万国数据冠名教授、首席研究员,国家级高层次人才、IEEE Fellow

  前微软亚洲研究院首席研究主管,长期从事 AIoT、端侧智能研究

  获得了 MobiCom、MobiSys、SenSys 等多个国际顶级学术会议奖励,以及 CCF 科技进步一等奖等奖项。

  曹婷

  清华大学教授,北京市高层次引进人才

  前微软亚洲研究院首席研究主管,研究方向为边缘智能、具身智能等

  获顶级会议最佳论文奖四次,工作入选 ACM/Microsoft 研究亮点等,其中 ACM 研究亮点由图灵奖获得者 David Patterson 亲自撰文推荐。

  *本文系量子位获授权刊载,观点仅为原作者所有。