马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一

  新智元报道

  模型吃掉应用的故事反了,「可以玩的抖音」开源视频世界模型。

  过去几个月,实时视频世界模型突然成为一张拥挤的牌桌。

  PixVerse、LingBot、阿里「快乐生蚝」、智象未来等团队,先后发布实时视频世界模型、Demo,并不约而同地把第一站指向互动内容/互动娱乐/ AI 游戏。

  它们讲述的故事高度相似:当视频能够持续生成、实时响应,人就不再只是观看一段内容,而是可以进入一个由模型生成的世界。

  一个强烈的行业预期正在形成:视频模型正在越过 AI 短剧的边界,向互动娱乐腹地推进。

  熟悉的味道,像是又一次「模型吃掉应用」的前奏。

  不过,新智元了解到一个特别的玩家打破了这个局面:Loopit 发布了实时互动世界模型 Zing-0.5,在美团 LongCat 与复旦大学联合推出的可交互视频世界模型评测 WBench 中拿到第一。目前已经开源,并计划在 2 周内在 Loopit APP(海外版)上线对应产品功能。

  没有看错,就是那个以「可以玩的抖音」被外界熟知的 Loopit,其产品上线后曾获马斯克点赞,两个月登顶欧美娱乐榜,累计融资 1 亿美元。

  这家擅长做C端产品和全球增长的应用公司,反过来做出了自己的实时互动世界模型,并在公开评测中拿下第一。

  模型吃掉应用的故事,似乎被反了过来。

  但这次发布真正值得关注的,还不只是一个应用公司下场做模型拿到第一。

  Loopit 还提出了三个颇具争议的判断:

  第一,空间探索与实时语义生成的联合控制,只是实时视频世界模型进入互动内容的入门门槛。

  第二,纯实时视频流无法直接走到世界模型终局。多人、持续、可互动的数字世界,需要先由 Code 维护状态、规则和因果,再由 Pixel 完成开放的生成式渲染。这也是本次模型命名为 Zing-0.5 的原因。

  第三,模应一体不是商业模式选择,而是走向端到端互动世界模型和构建互动内容产品的必经阶段,只有先把模型放进真实产品,积累「意图—行动—世界变化—用户反馈」的完整轨迹,未来才可能进一步把状态、规则和渲染统一进一个模型。

  Loopit 一边开源实时视频世界模型,一边戳破实时视频模型的「世界梦」。

  它并不否认端到端的终局,而是提出了另一条抵达终局的路径:

  先用 Coding × Pixel 把世界运行起来,再让端到端模型从这个世界里长出来。

  开源 github 地址:https://github.com/seedleap/zing-world-model modelscope

  模型下载地址: https://modelscope.cn/models/seedleap/Zing-0.5 huggingface

  模型下载地址:https://huggingface.co/seedleap/zing-0.5

  以下是新智元了解和实测的详细内容。

  Zing-0.5 在公开评测 WBench 中拿到第一

  一个可互动的世界,既要允许用户控制「去哪里」,也要允许用户决定「发生什么」。

  Zing-0.5 通过两条同时运行的控制链路,让用户一边用键盘或手柄探索空间,一边用自然语言改写接下来发生的事情。

  Loopit 将这项能力概括为「联合控制」:

  空间操作决定用户去哪里;

  语义输入决定世界发生什么;

  两种控制共同作用于同一段持续生成;

  新指令进入当前世界,而不是用一段新视频替换当前世界。

  围绕这条控制链路,新智元体验了五个逐步加深的 Case。

  Case 1:飞行没有中断,巨龙开始喷火

  在骑龙飞行约 43 秒后,输入「龙嘴巴喷火」。

  火焰与烟雾随即出现,但巨龙仍沿原方向飞行,洞穴、瀑布和远处光源没有被重置。喷火结束后,飞行继续,前后仍是一段完整的世界演化。

  骑龙飞行 43 秒后输入「龙嘴巴喷火」

  Case 2:一句指令,同时改变人物和多座雕像

  第二个 Case 把难度提高了一层。

  在石像场景的第 14 秒,新智元输入:

  祈祷:主控人物跪地祈祷,所有人脸雕像睁开眼睛。

  人物随即跪地,雕像睁眼并发光。角色继续移动时,原有人物和雕像仍保持各自的位置,玩家也可以继续观察结果。

  这要求模型不仅理解「发生什么」,还要区分「谁发生变化」以及「哪些对象同时变化」。

  主控人物祈祷,多座雕像同时睁眼

  Case 3:第一条改写仍在生效,第二条指令已经到来

  第三个 Case 从相同初始画面、相同操作轨迹和相同 Prompt 出发,将 Zing-0.5 与同类模型进行对比:

  • 第 4 秒输入「暴风雪」,改变全局天气;

  • 第 22 秒输入「远方人像睁眼」,改变局部对象。

  难点在于,第二条指令必须发生在已经被暴风雪改变的世界里,而不是重新生成场景。

  结果显示,在连续改写任务中,Zing-0.5 能够更稳定地把新指令写入当前世界。

  相同起点下的「暴风雪—远方人像睁眼」连续改写对比,左侧为 Zing-0.5,右侧为另一开源模型

  Case 4:一直向前走,主角和通道还能保持原样吗

  连续生成的难点,并不只是多生成几秒,而是不要越走越偏。

  连续生成的难点不只是多生成几秒,而是不要越走越偏。

  从相同画面出发持续前进时,Zing-0.5 中老鼠的耳朵、体型和黄色背包基本保持稳定。同类模型则逐渐出现角色颜色、比例和形态变化,通道墙面和方向也明显偏移。

  同起点、同操作下的持续前进对比,左侧为 Zing-0.5,右侧为另一开源模型

  Case 5:加入一朵蘑菇,不能顺手换掉整个世界

  第五个 Case 选择了一个像素风格的游戏世界。

  第 7 秒,新智元输入:

  一个蘑菇出现在前方。

  两边都生成了蘑菇,但 Zing-0.5 延续了原有像素风格,角色、道路和远处建筑仍属于同一个世界。

  响应 Prompt 和保持一致性是两种不同的能力。实时生成不仅要知道增加什么,也要知道什么不该改变。

  像素世界中途生成蘑菇,左侧为 Zing-0.5,右侧为另一开源模型

  新指令如何进入一个正在运行的世界

  五个 Case 测试的其实是同一个问题:新指令能否进入当前世界,而不是替换当前世界。

  为此,Zing-0.5 设计了两条独立、但共同进入 Causal DiT 的控制链路。

  语言和操作两条链路共同进入 Causal DiT

  移动、转向和视角变化等连续信号经过 sin/cos 编码与因果时序卷积,形成逐帧 action residual,并与对应视频 token 对齐。文本条件改变时,动作链路仍然连续运行,所以巨龙能够一边飞行一边喷火,人物也能一边移动一边观察环境变化。

  训练时,Zing-0.5 会在自回归生成中途切换 Prompt:保留已经生成的视觉历史和操作历史,再用新的文本条件预测后续内容。

  因此,「中途改写」不是在线推理时额外拼接的功能,而是模型从训练阶段就开始学习的能力。

  action residual 让世界继续运动,cross-attention 把新指令写入当前生成;两者共同决定接下来发生什么。

  连续生成,难的不是更长,而是接住自己的错误

  很多视频世界模型最开始的几秒都足够惊艳,但角色持续移动、反复转动视角,再加入新的动作和事件后,误差会逐渐累积。

  原因在于,模型后面看到的「历史」不再是真实视频,而是自己刚刚生成的结果。

  为此,Zing-0.5 会在训练中主动扰动部分历史画面,加入噪声、轻微模糊、颜色偏移和视角变化,模拟连续生成中的误差;训练目标则始终保持干净、正确。

  模型需要从不完美的历史中判断:哪些是世界真正的状态,哪些只是生成偏差,并预测出更稳定的未来。

  这套方法主要发生在训练阶段,不需要在线增加额外的纠错模型。它改善的不只是单帧观感,更是世界持续运行后的角色、结构和视觉一致性。

  带扰动历史、当前扩散块与干净训练目标

  5B、消费级显卡和六分钱:互动必须先过经济性这一关

  一个世界即使能够被控制、能够连续生成,如果每次操作都要等待,交互体验仍然无法成立;如果每一分钟都需要昂贵算力,它也无法成为大规模消费内容。

  在内部测试中,Zing-0.5 使用单张 RTX 5090 生成视频可以超过 24 FPS;按照线上服务对应的推理配置,一分钟流式视频的推理成本约为人民币 6 分钱。

  为了实现上述极致的成本控制,Zing-0.5 通过 DMD 将原本需要多轮计算的视频生成蒸馏至 4 步;推理时使用增量 KV Cache 复用视觉历史,只有用户更换指令时才更新文本条件。

  5B 的模型规模同样是产品导向的选择。Loopit 没有单纯依靠增加参数换取效果,而是把联合控制、一致性、实时性和成本放进同一个约束中。

  模型不仅要生成 Demo,还要进入真实产品,被用户持续使用。

  然而,恰恰是在把实时视频能力做出来之后,Loopit 团队更加笃定此前的判断——

  实时视频不是世界。

  戳破实时视频的「世界梦」:先让 Code 维护世界状态

  Loopit 技术联创 Henry 曾担任 Seedance 后训练负责人,他对实时视频路线的判断很直接:

  「多人、持续、可互动的数字世界,需要稳定的状态、规则、记忆和多人一致性。这些不能在今天全部交给视觉模型完成。现阶段,需要由 Code 承载世界状态、Pixel 负责生成式渲染,先让世界真正运行起来。」

  一座桥在画面中坍塌,并不代表系统知道桥已经不存在。一千个用户分别看到合理的画面,也不代表他们生活在同一个世界里。

  画面只需要看起来合理,世界的事实却必须持续正确。

  世界不是一串连续像素,而是一条连续的后果链

  一个长期运行的世界必须知道:此刻有哪些实体存在,每个实体处于什么状态,什么事情已经发生,哪些规则仍然有效,一次行动改变了什么,以及不同用户是否共享同一套结果。

  如果这些信息全部隐含在视频上下文中,模型每生成下一帧,都在重新推断「接下来最可能出现什么」。短时间内,它可以制造极强的世界感;但时间越长、实体越多、交互越复杂,视觉上的合理就越难等同于事实上的成立。

  视频模型仅能预测下一帧,而 Code 能维护并执行下一世界状态。

  AI Coding 负责把人的意图转化为可以运行的实体、状态、关系、规则、事件和逻辑,并在用户持续行动后更新这些世界事实;生成式渲染器负责把世界事实转化为连续画面、声音、运动、材质和光照。

  确定性来自可执行状态,想象力来自视频生成。AI Coding 让世界成立,视频模型让世界被看见。

  Zing-0.5 当前完成的,正是后面这一半,这是「0.5」这个名字真正想表达的技术边界。

  完整的 Zing-1.0,将是 AI Coding × 视频生成:行动不只改变接下来看到的画面,也改变世界事实;一次改变不只在当下出现,还会进入规则、角色、事件和其他参与者共同生活的世界。

  为什么互动世界模型必须「模应一体」

  为什么 Loopit 不直接采购外部模型,而要自己训练模型、搭建产品闭环?

  Loopit CEO 陈炜鹏曾是百川智能联合创始人和大模型技术负责人,他的判断是:

  有成熟数据的领域,例如文本模型和文生视频模型,纯模型路线大概率胜出;

  没有成熟数据的领域,例如自动驾驶和互动世界模型,模应一体路线大概率胜出。

  大语言模型有海量网页,文生视频模型有海量视频。但互动世界模型需要的不只是画面,而是「用户想让世界怎样改变—系统如何响应—用户是否满意—接下来又做了什么」的完整轨迹。

  这种数据不存在于现成数据集中,也很难靠人工标注获得。模型必须先进入真实产品,让用户用继续、退出、分享和 Remix,定义什么样的互动真正有趣。

  这可能催生一种介于短视频、游戏和社区之间的新内容形态:用户不只观看或选择分支,还能在体验过程中继续改变内容;一个人的行动和创造,也会成为其他人体验和 Remix 的起点。

  新的内容形态既没有现成的好坏标准,也没有规模化训练数据。必须先有一个产品容器,让用户真正玩起来。

  这就是 Loopit 所说的「模应一体」:

  产品出题,模型解题,用户判卷。

  产品把真实需求和失败转化成模型任务,模型迭代改善体验,再吸引更多用户创造和反馈。应用与模型共同生长,才能逐渐积累「意图—行动—反馈—后续选择」的独有数据。

  为何 Loopit 如此笃定这条非共识路线?

  新智元梳理 Loopit 此前的访谈、产品迭代和公开信息发现,AI Coding × 多模态生成的 Co-Design 路线,以及「模应一体」的判断,并不是 Zing-0.5 发布后临时补上的叙事,而是团队此前反复提出并持续实践的方向。

  这种笃定,很可能来自 Loopit 同时拥有两种很难出现在同一支初创团队里的视角。

  第一种,是横跨 Coding 模型与视频生成模型的技术架构视角。

  陈炜鹏和李施政来自百川智能,Henry 曾负责 Seedance 后训练。这样的团队组合,天然能够同时看到两类模型各自擅长什么。

  第二种,是来自大规模真实用户的新型互动内容需求视角。

  截至发稿前,Loopit 内部数据显示,平台已经拥有超过 500 万注册用户,用户创作了近 1500 万份互动内容,累计游玩超过 20 亿次,并产生近 500 亿次交互轨迹。

  模型能力、产品场景和真实数据闭环,同时出现在同一个组织中。

  这可能才是 Loopit 践行「模应一体」路线最大的底气。

  是模型吃掉应用,还是从应用长出模型?

  回头看,Zing-0.5 的信息价值从来不在于 Loopit 又发布了一个实时互动世界模型。

  真正值得讨论的是,这家公司正在对行业最流行的直觉提出反问。

  当实时视频越来越逼真、越来越长,它就会自然成为世界吗?

  还是必须先让 Code 维护状态和因果,让 Pixel 负责开放渲染,在真实产品中把世界运行起来?

  Loopit 并不否认端到端的终局。它的判断是:纯 Pixel 无法凭空抵达端到端。必须先有 Coding × Pixel,先有真实运行的世界和用户交互闭环,才可能把状态、规则、因果与渲染进一步统一进一个模型。

  因此,模型与应用的关系也被反了过来:不是先训练好一个世界模型,再寻找应用;而是模型先进入应用,从真实世界的运行和反馈中,逐渐长成更完整的模型。

  从下一帧到下一状态,再从混合架构走向端到端,互动世界模型的路线之争才刚刚开始。