扎克伯格谈Muse:AI Agent爆发,“元宇宙、智能眼镜和大模型”三大赌注完成交汇

  三年前,Meta CEO 扎克伯格在 Joe Rogan 节目上说过,有一天人们戴上眼镜、AI Agent 就会随之出现。如今,这一幕或正在发生。

  Meta 推出的个人 AI Agent——Muse 上线两周用户即达数百万。扎克伯格在 9 月 25 日一档访谈节目中表示:“每隔几年我们才能遇到这种情况。”他将 Muse 的早期反响定性为“一出手就是全垒打”——这在 Meta 产品历史上属于少数。

  与此同时,他宣布 Muse 将整合至全线 Ray-Ban 智能眼镜,用户无需再说“嘿 Meta”,而是可以自定义唤醒词直接呼叫自己的个人 AI Agent。

  多年来被外界视为三场独立豪赌的元宇宙、智能眼镜和大模型,正在 Meta 内部产品层面加速合流。

  在这场访谈中,扎克伯格还坦承了 Llama 4 失败是“最可怕的时刻”,并透露 Meta 正在建设 5 吉瓦级训练集群,认为足够大的算力可“暴力破解”AGI。

  Muse 为何能“一出手就是全垒打”

  Muse 的起点,是扎克伯格和团队成员 Nat 与 Alex 坐在一起,用开源工具在家里“拼凑”出一个早期版本。

  “我们意识到,这是一种神奇的体验,”扎克伯格说,“如果我们能把它做成任何人都可以用——不需要自己买 Mac Mini、不需要在终端里折腾——那么这将是数十亿人想用的东西。”

  这句判断,驱动了此后整套研发逻辑:不只是训练模型,而是从模型、脚手架、到 Agent 的“心跳”机制全栈自研——Agent 会定期自动唤醒,检查用户目标,主动推进待办事项。

  上线后的数据印证了这一判断。两周,数百万用户。

  个人 AI:重点是执行、记忆与“判断力”

  对于个人 AI 与通用 AI 的差别,扎克伯格将当前竞争焦点概括为让模型成为更好的 Agent。

  “过去一年最大的事情,基本上就是编程 Agent。”他说,编程能力很重要,因为即使用户没有直接写代码,“你的 Muse 也会在后台一直为你写代码,去完成各种事情”。

  但他认为,个人 Agent 不能只具备编码或任务执行能力,还需要理解隐私边界和社交语境。

  扎克伯格举例称,用户让 Muse 预订餐厅时,Agent 可能知道用户存在过敏情况或怀孕等信息,但并不意味着这些信息应该被自动披露。“你会希望它完成任务,同时尽可能少地披露信息。”

  他称,这种能力属于人类通常具备的“基本社交技能或常识”,但如果只是训练编码 Agent,许多公司并未将其纳入模型能力范围。

  “我们训练的是整个模型,而不是拿别人的现成模型,再在外面搭一个框架和 Agent。”扎克伯格说。Meta 还在产品层面加入记忆、任务追踪、虚拟角色动画和实时语音互动等功能。

  在个性化方面,他表示,Meta 并不认为 AI 应该只有一种固定人格。“很多实验室都在关注怎样把人格调到正确状态,但我从来不认为人格只有一个正确答案。”

  他称,Muse 允许用户修改头像、声音和基础性格,模型设计目标是具备较高的可操控性。“你可以定义自己希望如何与它互动,这对个人 Agent 很重要。”

  每个 Agent 都有自己的“电脑”

  Muse 区别于其他 AI 产品的核心基础设施之一,是 Meta 为每个 Agent 单独配备了一台安全虚拟机(Secure VM)。

  扎克伯格解释了为什么这是必要的:

你的 Agent 会了解你很多敏感信息。我们不认为这些信息应该跟所有人的数据混在一个池子里。

  他把 Muse Secure VM 比喻为“放在你桌子底下的那台只属于你的电脑”——用户数据加密存储,密码等敏感凭证通过独立安全模块管理,Agent 本身无法直接读取。

  在此基础上,Meta 还设计了“Sentinel”安全 Agent,专门监控进出 Muse 的数据流,一旦检测到异常或高风险操作,会直接拦截并提示用户授权。

  元宇宙、智能眼镜与 Agent,三条路线正在汇合

  扎克伯格在访谈中透露,Muse 将全面接入 Ray-Ban 系列智能眼镜,并对现有交互方式做出升级。

  目前的眼镜是“单轮对话”体验——说一句,得一个回复,结束。接入 Muse 之后,眼镜变成 Agent 的前端入口:用户开口,后端 Muse 在安全虚拟机里持续工作,完成任务再反馈。

  对于眼镜的产品路线,他描述了一条清晰的硬件梯队:

  • 无摄像头的纯音频眼镜:已搭载 Muse,可处理通话、音乐、语音任务
  • 带小显示屏的 Meta Ray-Ban:已发布,具备基础视觉反馈
  • 全视场角全息 AR 原型:已发布,扎克伯格称“会非常令人兴奋”

  他称,Meta 在眼镜上的长期投入,使公司在 AI Agent 成熟后处于较有利的位置。Meta 正在将 Muse 及更多 AI 功能引入眼镜产品,而过去相对更强调“临场感”的元宇宙技术仍在继续推进,只是当前更多资源转向了 Muse 和智能眼镜的 AI 功能。

  对于虚拟形象,扎克伯格称,Meta 此前需要通过房间级设备、多角度扫描以及企业级 GPU 环境,生成较高质量的写实化身;目前,用户通过少量照片即可完成设置,相关能力已可运行于一副 VR 眼镜中。

  展望 2030 年,扎克伯格称,元宇宙的核心愿景始终是融合物理世界和数字世界。他举例称,未来人们可以在线下与通过全息影像接入的朋友共同参与活动;在工作场景中,人类与多个 Agent 也可以共同参与群聊或会议,Agent 可以以全息形象或其他具身化形式出现。

  “最可怕的时刻”:Llama 4 的失误

  并非所有押注都一帆风顺。扎克伯格在访谈中罕见地直接谈及了 Llama 4 的失败。

Llama 4 之后,那是最可怕的时刻……我以为我们在正轨上,但我们没有。这是一个相当大的负面意外。

  他把问题归结为团队结构的根本性错误:

我按照 Instagram 推荐系统或广告系统那种方式来组建团队——几百上千人并行推进。但训练语言模型需要的是一支紧密协作的小团队,把它当作一个群体科学项目来做。每个席位都极为宝贵。

  由此,Meta 彻底重组,从业内广泛引入顶尖人才,成立 Meta 超级智能实验室(Meta Super Intelligence Lab,MSL)。扎克伯格表示,新一代模型即将发布,但不会在 Connect 大会上公布。

  算力路线:暴力破解 AGI,5 吉瓦项目在建

  谈及通往 AGI 的技术路径,扎克伯格给出了一个直接的判断。

我不确定还需要什么根本性的架构突破……我认为我们已经大致知道配方了。如果你能建造一个足够大的超级计算机集群,就可以暴力破解,到达那里。

  目前 Meta 的算力扩张路线:俄亥俄州超过 1 吉瓦的集群已基本投入使用,用于训练下一代模型;路易斯安那州 5 吉瓦级集群正在建设中。

  他表示,“当你拥有多吉瓦集群进行训练时,你基本上就会得到某种接近 AGI 乃至超级智能的东西。”

  不过他也补充,当前算力驱动路线并不意味着架构研究不重要——

人脑只消耗约 10 瓦,而我们的系统可能比它低效一百万倍。如果把大规模算力和架构突破结合起来,才能真正领先。

  对齐,不是负担,是产品必须解决的问题

  扎克伯格对 AI 安全的态度很务实——他不把它视为监管压力,而是产品能否成功的前提。

如果你让 Muse 做一件事,它却做了相反的事,谁还会用它?我们需要让模型不只是理解你的具体指令,还要理解你的意图和你的价值观。

  “Muse 要触达十亿用户,我们就必须解决对齐问题,或者说在这上面取得非常大的进展。”他说。

  对于训练过程中的安全边界,他用了一个类比:“就像父母给孩子立规矩——如果它通过修改系统配置来'完成'一道编程题,我要告诉它:不,我让你去学解题方法,不是让你找捷径绕过去。”

  访谈全文如下:

大举押注

主持人: 这件事将会有数十亿人想要使用。对您来说,做建设是一种怎样的感受?"永生"是一种可能吗?好,如果您带我进入您的思维,快进到 2030 年,那会是什么样子?

这位是马克·扎克伯格。22 年前,他构建了一个连接数十亿人、永远改变了世界的社交网络。而如今,他决定建造更宏大的事物。为此,他正在元宇宙、智能眼镜和人工智能领域大举押注。多年来,怀疑者认为这是三场各自独立、不可能成功的赌注,但他们忽略了更宏观的图景——因为当下,这些押注正在汇聚,共同创造出一种全新的超级智能。

今天,我们将向大家呈现这一切,我也将向马克提出一些他从未被问过的问题,倾听他对未来的愿景,让您能够提前布局,构建下一件大事。

主持人: 非常感谢您来到节目。

马克: 谢谢,很高兴来这里。

主持人: 为了这次对话,我把您做过的每一次采访都看了一遍。

马克: 好家伙,那比我自己看的还多。

主持人: 很好玩,收获颇丰。有两件事给我留下了深刻印象:第一,您对"建造"的热爱,我感觉您就是最顶尖的建造者之一;第二,您押注的能力——敢于做出巨大的赌注。我觉得这周,所有这些押注正在汇聚到一起,所以我们就从这里说起吧。

马克: 好的。这些事情我们已经做了很长时间了。AI 方面,作为一家公司,我们几乎从创立之初就在做了——第一版新闻资讯流在某种程度上就是一个机器学习产品。然后我们大约在 15 年前创建了 AI 研究实验室。

但现在我们进入了新阶段——大约一年多前,我们启动了 Meta 超级智能实验室。这是一次相当彻底的研究重启,从整个行业引进了大量优秀人才,令人振奋。目前,我们看到模型越来越好,下一代模型即将发布,不过不是在 Connect 大会上宣布。此外,我们还有 Muse 个人助理,目前来看反响非常好。

在构建这些东西的时候,你其实并不确定结果如何。我们自己是喜欢的。早在今年年初,我就在家里用自己的方式把 Open Claw 拼凑起来,感受这个东西是怎么运作的,以及怎样才能把它打造成一种任何人都能使用的神奇体验。

基本上,当我们——我、Nat 和 Alex——坐在一起,意识到这是一种神奇的体验,并且如果能把它打造成一个开箱即用的版本,让那些不懂技术、不想去自己安装 Mac Mini、不想进终端折腾、也不想在出问题时调试的普通人也能用的时候,我就觉得,这将会是数十亿人都想要使用的东西。

从那以后,我们一直在围绕这个目标努力:专门为它调优模型,不仅构建了助理本身和运行框架,还构建了为每个助理提供独立计算环境的技术——我们为此构建了整套 Muse 安全虚拟机。

我们内部一直觉得这很特别,内部人员也很喜欢,但你永远不知道产品发布后大家会怎么反应。偶尔会出现一鸣惊人、开门红的情况,但大多数时候你会收到一些正面反馈,还需要迭代几个地方才能真正让产品"咔哒"一声落地。而这一次,它一出来就直接"咔哒"了。看到这一切发生真的非常令人振奋——才两周,使用人数就已经有数百万,这相当罕见。每隔几年我们才能遇到这样的情况,但这绝对是创业公司最令人享受的时刻之一。

主持人: 您能坚持在赛场上、不断尝试,这让我非常佩服。而且这么多次都打出了安打,真的很厉害。您之前有一次和乔·罗根的访谈,大概是三年前,最后您提到有一天可以直接戴上眼镜,AI 助理也会随之出现。所以我感觉 Muse 已经有实体化的形象,这一点非常聪明,因为那感觉是必然会发生的事。

马克: 我觉得这也只是让它显得更友好可爱。我认为太多人把 AI 描述得像个令人恐惧的东西,但 AI 应该只是有用又有趣的。那个实体化的形象——项目早期有位设计师做出了那个角色,不知为何他们一直想迭代,但第一版就是最好的。后来有人说,"哦,它得是蓝色的,因为是 Meta 嘛。"我说,"不,我觉得这个形象就是对的,你第一次就钉住了。"就这样,就是好玩。

个人 AI 与通用 AI 有何不同?

主持人: 很好的细节。如果您想让模型在个人事务方面表现得非常出色,而不仅仅是通用智能模型,那么训练方式会有什么不同?

马克: 我认为目前的核心在于让模型成为优秀的"智能体(agent)"。过去一年,最大的风口是编程智能体,其中蕴含两个核心思想:编程专业能力,以及成为优秀智能体的通用能力。

我们的策略是,将智能体本身做好放在首位,而不是专攻编程能力。

编程能力之所以重要,是因为即使用户自己不认为在写代码,Muse 也在后台一直为你写代码来完成各种任务。但我们认为,智能体应该首先是一个出色的智能体,编程能力服务于此目标。

此外,在构建个人助理时,有些事情比构建企业软件产品更为重要。比如,如果你在构建一个企业编程工具,模型根本不需要有任何关于"信息披露尺度"的概念——比如什么信息该说、什么不该说。但对于 Muse 来说,这非常重要。

你需要把这种能力训练进模型里,就像训练其他任何能力一样。你会告诉它很多事情,然后希望它去帮你实现目标。比如,你想让它帮你订餐厅,你在找一家合适的餐厅,但你可能有某种过敏症,或者你怀孕了,而你可能不想把这些透露给餐厅。但 Muse 会知道这些信息,你希望它在尽量少透露信息的同时完成任务。这是一种具体的技能,本质上是人类的基本社交常识。

但那些只做编程智能体的公司,大多数都没有把这种能力训练进去。我们之所以能做到,是因为我们在做全栈——我们不是从别人那里拿来一个现成的模型再套个框架,我们是从头训练整个模型,专门为这些能力服务。

模型当然需要具备广泛的通用智能,但它同时也具备这些特定能力。然后在此基础上,你构建整个助理,以及它周围所有的细节:记忆、运行框架,还有它"心跳"的方式——它定期唤醒,检查一下"好,这些是我了解的关于你的目标,有什么我现在可以推进的吗"。

我们还有一个专门的团队,只负责打磨虚拟形象的实时动画效果,因为不仅仅是默认形象——你可以自定义任何形象,然后它就自然地动起来,效果非常棒。我们还在推出语音模式,你可以进行实时语音对话,你的助理就在那里陪着你。这些细节,我觉得都源于我们在做全栈——模型和产品是一起开发的。

主持人: 另一件大事是虚拟机。能解释一下它为什么重要,以及它解锁了什么吗?

为什么 Meta 要为每个 AI 助理配备独立计算机?

马克: 基本上,一个智能体要能替你做事,就需要一个地方来存储你的信息。我们认为这些信息不应该和其他所有人的信息混在一个资源池里。

可以这样理解:你的助理会知道很多关于你的敏感信息。很多人最初接触 OpenCloud 这类智能体时,会在家里自己配一台 Mac Mini。于是我们想,很多人并不想买 Mac Mini 或者自己设置。那么,什么样的体验能最好地近似这种效果呢?答案是:你只需下载一个 App、注册,就能获得一台专属于你的计算机,供你的助理工作、存储数据,并围绕此建立安全模型。这样就近似于在你桌下有一台自己的电脑——就连我们 Meta 也无法访问。

比如 Muse 机密虚拟机,这是我们正在开发的功能,就连我们自己也无法看到你虚拟机里的内容。

我们还围绕这些构建了很多东西,比如安全凭证存储——当你的助理需要处理密码之类的信息时,它本身不需要能看到这些密码,只需要在你要求它登录某个服务时能"插入"凭证,并且只在你明确要求时才这样做。系统应该这样设计:那些信息本身就不可随意访问,因为意外总会发生,有人可能试图入侵,或者系统可能出现问题。

所以你要确保智能体无法访问这些数据,Meta 也无法访问。为每个助理提供独立计算机,并把安全性做到极致,是这项技术的根本基础——既赋予 Muse 帮助用户实现目标所需的能力,也保证了隐私和安全,使其成为该领域世界级、行业领先的产品。

主持人: 那这是否意味着,就像 WhatsApp 一样,Muse 连接到的虚拟机上的数据是加密的?人们该如何理解数据在虚拟机中的实际存储方式?

马克: 我们基本上构建了两个版本。Muse 安全虚拟机(Secure VM)包含各种隐私功能,其中包括我们构建的整套 Sentinel 智能体架构。你有一个正在为你执行任务的普通 Muse 助理,同时还有一个我们称为 Sentinel 的安全智能体,专门监控进出你的 Muse 的数据流。

如果有外部内容试图破坏安全,Sentinel 会直接切断,阻止其发生。如果它认为你的 Muse 即将采取某个需要你介入的行动,它会覆盖 Muse 的操作,并触发提醒,让人来确认权限——比如"你希望 Muse 能做这件事吗?"

这整套系统,加上安全凭证存储,再加上多层纵深防御,共同构成了 Muse 安全虚拟机。

我们还在开发另一个项目。Nat 和我专门招募了 Moxie Marlinspike——他就是当年和我们合作实现 WhatsApp 端对端加密的那个人——来设计 Muse 机密虚拟机(Confidential VM)。其核心思想是,在安全虚拟机的基础之上,再赋予你一个专属加密密钥,使得连 Meta 都无法访问其中的内容。

这个版本实现难度更大,因为如果 Meta 无法访问虚拟机内部,调试和保证系统正常运行就困难得多。所以我们花了一些时间,但很快就会推出。这基本上将达到人们在 WhatsApp 以及我们其他最安全产品上已经熟悉的安全标准。

主持人: 这样做的优势,只是让人们心理上觉得更安全,还是有实际的好处?

马克: 我认为安全本身就很重要。我们的目标是近似于让你在桌子下拥有一台本地机器。那台本地机器能给你什么?它意味着没有任何公司能访问它。

所以,假设 Meta 想为你提供这项服务,我们怎样才能给你同等级别的隐私和安全保障,使得没有任何公司——无论是 Meta,还是任何试图入侵我们的人,或者在某些国家,你不信任当地政府的情况下——都无法访问它?因为我们自己也进不去,因为我们没有访问权限。

我认为这非常重要,这也是人们信任 WhatsApp 的重要原因。这对隐私、安全和信任来说是真实存在的价值。

如果你要拥有一个对你的一切了如指掌的助理——我猜几乎我们所有人都会拥有这样的助理——快进 5 年,每个人都会有一个能深入了解你的目标和一切的助理,并能帮你完成事情。在这种情况下,在隐私和安全方面做到行业领先就非常重要。我们从一开始就想这样做。

如何塑造 AI 的个性?

主持人: 您还有一点很有意思——您在大学学过心理学。

马克: 嗯,在那里只待了很短的时间,两年,但我感觉它影响了我后来构建的很多东西。

主持人: 我们看模型的时候,经常会说某个模型"非常聪明"。但就像我们选择朋友,肯定是因为他们聪明,同时也因为我们喜欢他们的能量和相处方式。您在塑造模型个性方面是怎么考虑的?

马克: 我认为理想的模型应该有足够的适应性,能够契合不同人的风格。我觉得很多行业人士在这一点上都搞错了方向——很多其他实验室都在专注于"如何把个性设计对",但我从来不认为个性是一个固定的东西。这也是我如此坚信开源、如此坚信人们能够定制化的原因之一,也是我们把 Muse 设计成一个高度个人化产品的原因。

你可以自定义和个性化 Muse——不只是形象和声音,在你第一次注册时,它问你的第一件事就是"你希望我的基本个性是什么样的",而且你随时可以去修改。

我们努力让模型具有很强的可引导性,让你能定义自己想要的互动方式。这是让它成为优秀个人助理的重要组成部分——这种围绕个性的适应性非常关键。

主持人: 您自己的 Muse 是什么风格?

马克: 我让它直接、注重效率。它挺有意思的。早些时候的版本很爱讽刺、很幽默,但现在这个版本更直截了当。我的助理用的是默认的 Muse 形象,但我给他穿了一件托加长袍,还给他配了一个深沉到有些滑稽的嗓音,和他互动很有趣。

主持人: 我觉得要有幽默感,你必须真的很聪明。很多人没意识到,喜剧演员是社会上最聪明的一批人——反应要快,机智要够。您肯定有这个特质。看了您所有的采访,您一直表现很好。

马克关于 AI 与元宇宙的出人意料的预测

主持人: 您和 Theo 的访谈中,你们谈了很多关于技术的下一个前沿以及这一切最终指向何处。AI 领域曾经历过几个"寒冬",人们以为不会有突破。元宇宙也经历了几次这样的时期,大家觉得这是个无法兑现的赌注。我昨天试用了新的全息形象功能,非常酷。在和 Lex 的访谈里,感觉要花 11 个小时才能把您的脸录进去,现在只需要 3 分钟了。这是怎么推进到今天的?

马克: 在元宇宙的整体发展上,我们在创立 Reality Labs 时,始终认为最终会有外形正常的普通眼镜,并且随着时间推移,它既能提供沉浸式的临场感,又能成为出色的 AI 设备——因为眼镜是唯一能让设备看到你所看、听到你所听的形态,整天在你耳边与你交流,并最终显示图像。

但 10 到 15 年前,我当时假设我们会先实现全息技术,再有高度发达的 AI。然而技术演进的路径很有趣——我们实际上先有了 AI 和个人超级智能,然后才有技术来让全息技术变得足够普及和实惠。这是我没有预料到的,但我很高兴我们两个方向都在做。

我们在眼镜上的大量投入,让我们在 AI 助理准备就绪之际,处于了非常有利的位置。Connect 大会上的很多发布,正是关于把 Muse 和大量 AI 功能引入眼镜,我认为用户会非常喜欢。这是个大事。

关于临场感方面,我们仍在推进,但进度相对慢一些,因为我们大部分精力已经转向为眼镜构建 Muse 和 AI 功能。不过,我们有一个持续已久的项目,就是实时高保真的虚拟化身。

就像您说的,三四年前,你需要一整个扫描室从各个角度录入一个人,然后还需要企业级 GPU 才能渲染,非常费事。我们为 Lex 播客做的那个演示就是那种设置。而现在我们基本上让它在一副 VR 眼镜里就能运行——这是第一副能实现这种惊人 VR 体验的眼镜形态,而不是一个大头显。只需几张照片就能建立你的虚拟化身,进展之快令人惊叹。

主持人: 而且还能基于声音来驱动表情。在演示里,它让我笑,让我互动,然后理解我的面部如何随着音轨运动。您在那期播客里提到,一些平时表情比较内敛的人,实际上在虚拟世界里会想要更丰富的表情。您怎么看待人们区分"虚拟自我"和"现实自我"这件事?

马克: 我认为我们在理解这方面的社会学和心理学上还处于很早期的阶段。我觉得人们对自己的认知和想要投射出去的形象,往往和实际的自己有些不同。从社交网络诞生之初,人们就在精心挑选头像。在 Muse 的虚拟形象上,我们也看到了类似的现象。那不太是在"策展"自己,而是在"策展"你想要与之交流的那个"人"。

我认为,当你在给人们提供表达自我的能力时,你既希望它能真实捕捉到他们,同时它本身也是一种表达形式,而不只是纯粹的镜像映射——它既是传达,也是表达。我们希望能构建出兼顾两者的东西。这始终是一个迭代循环:看看人们怎么用,然后改进。经过多年工作,我们现在才真正站在了起跑线上——第一次能将相当高质量的写实化身真正做进产品里,在手机上可以用,在 VR 里也可以用。我非常期待看到结果。

2030 年会是什么样子?

主持人: 好,带我进入您的思维,快进到 2030 年,如果一切顺利,全息技术那边会是什么样子?全息加 Muse,加上眼镜,它们如何汇聚在一起?

马克: 我对元宇宙愿景的理解,始终是关于将物理世界与数字世界有效融合。基本理念是:我们有这个美好的物理世界,同时也有一个精彩的数字世界——互联网上 20 到 30 年来积累的海量内容,令人叹为观止。但我们访问它的方式,要么是坐在桌前,要么是通过口袋里的一块小屏幕,这从根本上看非常受限。

我认为这件事最理想的版本,就是物理与数字世界的无缝融合。可以这样想:现在我们两个人在这里。未来的某个版本里,我们其中一个人可能是一个全息投影,但你依然感受到彼此真实在场的那种感觉,这和视频通话完全不同。

而虚拟现实的核心,正是传递这种临场感——让你真切感受到自己与他人同处一室,或置身于另一个地方。你可以用全息技术实现这一点,并以各种方式混合。比如,我可以和朋友打一场扑克,一部分人在场,另一部分人通过全息形象加入,也能打牌,牌桌本身也可以是全息的,这样不在场的人也能融入其中。

与此同时,AI 也可以被赋予实体,出现在这个场景里。在工作场景中这很有意义——我现在就一直在用各种编程智能体来构建东西。试想一下:你有一个群聊频道,里面有几个人和几个智能体,你给智能体分配任务。但有时候,大家会聚在一起开会,智能体也许也应该在场。它们怎么出现?很简单,沙发上多几个位置,它们以全息形象出现就好。或者用 Muse 那个可爱的小角色,或者是龙,或者是任何你创造的奇奇怪怪的形象。

我猜这在未来会感觉相当自然。

主持人: 有意思。您之前的采访中说过,科技行业经常忘记"好玩"这件事。我觉得有个实体助理出现在那里,也会让感觉更真实——就好像真的把工作外包出去了。当你看到 Muse 在打字,就感觉有什么事情真的在发生。这一点做得很好——能看到浏览器里正在发生什么。那么您认为有没有可能出现这样的场景:你戴着眼镜,然后控制你的电脑,让 Muse 在电脑上帮你做事?

马克: 哦,肯定的。VR 已经可以做到了。你可以随便找个地方坐下,咖啡馆也行,然后打开你的工作站,有六个显示器,在上面写代码,一切都有。

眼镜这边,最受欢迎的那款目前还没有显示器,这样一方面可以让价格更实惠,让更多人使用,另一方面我们仍在努力让显示器做进最紧凑的形态里。但我们已经发布了 Meta Ray-Ban 的显示器版本,很受欢迎,是一块小显示器。我们还发布了全视场全息 AR 的原型版本,我认为会非常令人兴奋。

所以,整条产品线就是这样的:从纯音频眼镜——没有摄像头,看起来就是普通眼镜,但里面有 Muse,可以用各种音频工具、听音乐、打电话——到更高阶的版本,全都有。

主持人: 我在想,戴着那款音频眼镜,能不能一边跟 Muse 说话,一边让家里的电脑在做事?

马克: 对,完全可以。我们刚刚在 Connect 大会上发布了这个功能。现在所有眼镜都连接到 Meta AI,是一种"单轮"体验——你发一个提示,它回复,就这样。但有了 Muse,我们基本上要把所有眼镜都升级为 Muse。首先,你不需要再说"Hey Meta"了,你可以给它取任何名字,这本身就是乐趣的一部分。然后你就直接和它说话,它连接到你的 Muse,你的 Muse 在你的安全虚拟机里处理任务,帮你把事情搞定。

主持人: 太厉害了!

创始人心态

主持人: 好,我们现在在这里,Muse 进展很顺利,眼镜也做得不错,但大约一年前,很多人都在问"超级智能实验室到底怎么了"。在那个时刻,您内心是什么感受?当事情进展不顺、但您又看到了长期愿景,那是一种怎样的体验?

马克: 真正出了问题的是 Llama 项目和 Llama 4。

Llama 1 是一个相当有趣的模型,它开创了整个开源 AI 运动,我们对此非常自豪。Llama 2 实现了规模化,Llama 3 是一个很好的模型,在当时几乎达到了前沿水平。然后到了 Llama 4,我们基本上偏离了应有的发展轨迹。

每当事情没有按我预期的方向发展,我都会花大量时间思考:为什么会这样?我们需要改变什么才能做得更好?这次,我的反思是:整个团队的架构我搞错了。

我把它建模成了我们做 Instagram 信息流或广告系统这类机器学习工作的方式——有数百甚至上千人并行工作在很多事情上。但对于构建语言模型来说,你真正需要的是一个极其紧密的小团队,把它当成一个团体科学项目来做。人不需要多,但这意味着团队里的每一个席位都极其宝贵。

于是我们从 Meta 各处网罗了最优秀的人,同时从行业各地引进了很多牛人,组建了一个全新的团队——就是 Meta 超级智能实验室。

从我的角度来看,在 MSL 启动之时,我就知道这需要一段时间来重启、重建基础设施、训练下一代模型。但我知道我们拼起了一支出色的队伍,如果团队能磨合好、运转良好,结果就会很好。

对我来说,最惊心动魄的时刻,其实是 Llama 4 发布后——我以为我们在这条轨道上,结果发现并没有。那是一个相当大的负面意外。我想,作为创业者,你总会在这些时刻被考验,因为不可避免地,并非所有事情都会一帆风顺。而真正决定发展轨迹的,是:当事情没有按你希望的方向发展时,你如何找到前进的方法。

主持人: 我猜反过来也是如此——当某件事远超你的预期时,比如 Muse 的首发,你如何确保能把握住这个机会?

马克: 完全是这样。现在公司全员投入——最开始只是一个构建产品的小团队,但现在大家都意识到,这真的准备好了登上大舞台。全公司都在想,怎么把这个东西做大,怎么让数亿人都能体验到。

从优化所有基础设施让一切顺畅运行、榨干现有 GPU 的每一分算力,到各个产品团队以不同方式将 Muse 嵌入——比如眼镜。看到大家齐心协力,确保 Muse 能顺利扩展出去,这种感觉非常棒。

马克如何书写和传达愿景

主持人: 作为创始人,我觉得那才是你最向往的时刻——一切汇聚在一起。您是怎么向公司传达愿景的?在同时推进这么多事情的情况下,我感觉您写了很多。您的流程是什么?

马克: 写作对我很有帮助,既能帮我提炼自己的想法,也能对外传达。今年夏天,我写了一篇很长的文章,叫《未来属于所有人》,大约 15 页,帮我系统梳理了自己在 AI 相关各种重要社会议题上的哲学立场:我认为什么是好的,与政府的互动应该是怎样的,如何防范人们担忧的各种危害,如何让数据中心成为社区的财富,真正创造就业而非消灭就业,如何维护国家安全,如何切实缓解人们担心的风险——无论是黑客攻击还是生物安全之类的事情。

这是一件非常复杂的事,花了很长时间,和很多人交流,经历了很多轮修改,内部很多人参与讨论、辩论。但这对我来说是一个非常有价值的过程。最后我们就有了这样一个东西——15 页,"这就是我们相信的"。然后我把它精炼成一页的版本,作为专栏文章发表。我们还制作了一个短视频,因为我觉得要触达很多人,你往往不需要抛出一套理论论证,而是把它浓缩成:你的价值观是什么,你相信什么,你怎么传达。

在向公司或世界传达这些方面,没有一刀切的方式。不同时期需要不同的方法,不同群体的人,有些天然就认同你在做的事,有些则更担忧,需要你把他们带着走,需要额外花力气解释为什么这是有价值的。我认为这本身就是经营一家公司、作为一个创始人的一部分——你不是一遍遍重复同样的事,每一次所处的情境都略有不同,面临新的挑战,这也是它部分有趣之所在。

是什么驱使马克去建造?

主持人: 我觉得对您来说,这种创始人心态延伸到了公司之外——无论是您的农场,还是学习一项新技能。

马克: 我就是喜欢造东西。

主持人: 那对您来说,"建造"是一种怎样的感受?

马克: 我觉得那是一种内在的需求。不同的人有不同的自我表达方式。如果你是一个作家,你会感觉自己必须写。有些人有被认可的需求。但我就是需要建造东西。如果我不在运用创造力、不在建造什么,我就会变得脾气不好。这对我周围的人来说可不好受。

主持人: 学习成为一个优秀滑雪者,和学习构建一个产品,是同一种技能吗?

马克: 某种程度上是的,学习新事物的过程相当类似。在我的人生里,我刻意挑战过一些自己很不擅长的事情。比如,我一直非常不擅长学习语言。这实际上就是我最开始学拉丁语的原因——我在课堂上怎么也学不会法语和西班牙语,最后我想,好吧,拉丁语不用说,只用翻译,就像数学一样。

后来,我在开始经营公司时,给自己设立年度挑战,其中一年是学普通话。普通话真的很难,声调那个部分尤其如此。当然,学它有充分的理由——普里西拉的外婆只说普通话,所以如果我想和她交流,就需要学。但最大的动力其实是挑战本身。

所有这些事情,你只能去做,没有什么捷径可以"想明白"。你只能投入时间,然后它就慢慢渗进大脑里。学武术、学开直升机,也是一样——这些事情其实很难用理智去"理解",它们需要实战积累。

构建产品也有一部分是这样的。编程可以用理论方式思考,但构建产品的那种直觉,只能通过反复实战来培养。问题只在于你喜欢什么——因为我认为不是所有人都有和我一样强烈的建造需求,大多数人都有某种程度的需求,关键是找到那是什么,然后把时间投入进去,成为你真正想要在那件事上做到卓越。

老实说,我觉得这不仅仅是"想要",更是一种深层的心理需求或驱动力。把这种驱动力和某件事对齐,给自己时间让那些经验慢慢渗透沉淀,这非常关键。这也是我试图教给孩子们的——让他们找到自己真正感兴趣的东西,但如果他们遇到瓶颈,也要推一把。

我的一个女儿非常喜欢创作音乐,但她就是受不了上钢琴课。我跟她说:"你不需要成为钢琴大师,但如果你想创作音乐,你就需要对乐理和运作方式有直觉上的掌握。而且一旦你学会了钢琴,吉他你马上就能上手。"我觉得,无论是作为孩子需要家长推一把,还是作为大人,有纪律坐下来让这些东西慢慢在大脑里沉淀,都是关键所在。

建造者的黄金时代

主持人: 我觉得其实每个人都想建造。我认为Z世代也不像外界批评的那样——低能动性什么的。我觉得人们只是在寻找能够点燃他们建造力的火花。您在哈佛演讲里也谈到了很多这一点。

马克: 是的。我说"建造",主要是指这类产品——软件、硬件之类的。但我同意,我认为每个人都有某种创造驱动力。不过有些人有其他更强的性格特质压过了这一点,比如服务驱动——那些成为医生或护士的人,他们最核心的驱动力就是"我就是想照顾别人"。

我听说过一个故事,可能是普里西拉在医学院经历的:开学第一天,有人站起来问,"你们有多少人在小时候有过这样的记忆——看到某人,心里想着'我真的很想照顾那个人'?"结果所有人都举手了。对我来说,我的版本就是:我有很多小时候的记忆,是"我想去做这个东西,让它变得更好"。

不是每个人都有同样的驱动力,但每个人都有自己想做的事。我同意,有了以前的技术,对很多人来说,起步本身就很难。这也是我对个人超级智能、Muse 和各种 AI 助理最感兴奋的一点——我认为这是有史以来第一次,人们真的可以快速起步。你有一个模糊的想法,AI 可以帮你勾勒出轮廓,然后你去雕琢它,就像在塑造一件雕塑,而不需要在开始之前什么都已经懂得。

我认为这非常有力量,很多人将会因此找到他们想要创造或推动的事情。这将帮助人们感受到更广泛的能动性。

我们离攻克所有疾病还有多远?

主持人: 您在 Meta 之外的另一个项目是攻克所有疾病。我很好奇,第一,我们距离目标有多近?

马克: 比以前近多了。

主持人: 您觉得现实地来看有多近?

马克: 我们最初启动这个项目时,目标是在本世纪末帮助科学界攻克所有疾病。我们从来不是要自己去做,我们的理论是:所有重大科学进步,都以一种能够测量和理解某些事物的新工具为先导。比如发明了显微镜,然后我们理解了细菌;有了望远镜,帮助我们理解了宇宙。

这些工具有些还成了平台——比如第一个发明疫苗的人,之后人们就能用这个方法治疗很多疾病。

但历史上,科学资助的方式一直是广泛分散,让各人做个体探索,真正用于构建这些大型工具的资金并不多。我们在 Biohub 试图做的,就是设计几种新工具,赋予人们以新的方式"看见"生物学,从而帮助科学界加速进展。

最初我们认为"到本世纪末"已经是很有把握的目标了,很多生物学家当时还觉得这不可能。但现在我觉得,本世纪末太久了。

AI 的进展,加上我们正在做的虚拟细胞模型——其基本思路是,不用在真实的活体细胞上做实验,而是用 AI 模型来模拟蛋白质,进而模拟细胞,再往后模拟虚拟免疫系统,或者整个生命体,甚至整个人。这将让科学家能运行大量实验,模拟不同情况下会发生什么,比如给某人服用这种药物,身体会有哪些反应。

我不想给出一个精确的年数,但我猜会比本世纪末早得多。

主持人: "攻克所有疾病"这个目标措辞感觉很刻意,而不是"永生"。永生是一种可能吗?

马克: 这不太是我深耕的领域。我认为两者是两件不同的事。"永生"更多关于延长——即使你不会生病,人体本身也有一个自然的预期寿命,这是另一个需要单独研究的问题。有些人会认为这也是一种"疾病",这是一个合理的视角,但我认为,人们也需要同时努力攻克那些即使你把寿命问题解决了之后、仍然会让你生病的疾病。

我们选择的那部分问题,并不是说你永远不会感冒。我们的说法是"治愈、预防或管理":有些疾病可以被完全治愈;有些我认为我们将来能够预防;还有一些,也许你还是会生病,但本来会造成真正伤害甚至夺去生命的事情,你现在可以将它作为一种持续的慢性状况来管理,不会对你的生活质量造成实质影响。

目标是让人体保持在平衡状态——不是说我们永远不会接触到病原体,而是在某一天,我们能够治愈、预防和管理所有疾病。

马克脑子里出现最频繁的念头是什么?

主持人: AI 在很多不同的突破中都像催化剂一样,包括个人智能这个方面。您现在最常思考的是什么?在这个过程中,您脑子里出现最多的想法是什么?

马克: 这可能每周都在变。

现在非常专注于 Muse。每次发布一个东西、快速推进,然后和真实世界接触,了解人们的反馈,再弄清楚接下来要做什么——这个阶段总是令人兴奋的。我们现在就处于这个阶段,正在收集大量信息,了解人们想要什么。好消息是人们非常喜欢它,所以我们在努力让尽可能多的人用上它。

模型方面还有很多工作,Muse Spark 模型进展很大,我们希望继续推进,希望打造世界领先的模型。

下一步需要哪些突破?

主持人: 还需要哪些突破?

马克: 研究这种事,你未必能提前预知。我们对某些方向有一些预感,过去一年的工作很大程度上其实是在扩展基础设施。

大约一年半前,更多人会说,要达到超级智能,需要某些根本性的架构突破。但我现在不太确定这是否成立。我认为我们已经对"配方"有了相当的了解——如果你能建造一台足够大的超级计算机集群,就可以通过暴力计算到达那里。

我们正在建造俄亥俄州那个超过 1 千兆瓦的集群,基本已经上线,我们正在用它训练下一代模型。然后是路易斯安那州的 5 千兆瓦集群,很快就会投入使用。我估计,当你拥有多千兆瓦量级的集群在做训练时,你基本上就能得到接近 AGI,乃至 AGI 之上超级智能的东西。

但这不意味着这是最好的方式。人类大脑只需 10 瓦就能运行,而我们建造的这些计算系统,效率大概比人脑低一百万倍。所以我确实认为,在架构方面还有改进空间,我们也在努力探索——如果把巨大的算力和架构改进结合起来,你真的能建造出领先全球的东西。但就目前而言,规模扩展本身就能带我们走很远。

主持人: 确实,规模扩展是最有保障的路径。研究你得寄望于重大突破,但规模扩展很快就能起效。

马克: 正因如此,大公司都选这条路。也许存在一种便宜得多的方式,但我们目前还不知道。而这是一个对世界如此有价值的东西,即使要花数千亿美元,只要实现的概率足够高,就依然值得去做——确保即使最终没有找到更便宜的突破方式,你仍然有一条清晰的路径能实现它。当然,如果你找到了更便宜的方式,那就更好了。

所以我不想说这个问题"已经解决了",因为在扩展基础设施的每个阶段,你都会遇到各种新的工程难题需要调试解决。研究本身就是这种迭代的方式推进的。

如何赢得 AI 安全这场战役

主持人: 现在可能最重要的事情之一是专注于对齐(alignment),让模型变得可信赖。

马克: 是的。关于对齐,行业里有一场争论:这些 AI 实验室会自然而然地去做吗?我的观点是:当然会。如果你告诉 Muse 做一件事,它却做了完全相反的事情,我不知道有多少人还会想用它。我们必须确保模型不仅理解你具体问了什么,还理解你的意图和价值观,这样它才不会用一种你不满意的方式去做那件事,或者产生你根本不想要的负面影响。这种深层理解,本质上就是对齐。

所以我的看法是,要让 Muse 成功、触达数十亿人,我们就必须在对齐方面取得切实进展,而不只是说说而已。

主持人: 对齐是通过用户说"那不是我想要的"来实现,还是靠你们后台自己发现?

马克: 两者都有。用户反馈是有的,但我认为,越来越清晰的是:你需要在训练阶段就做对齐,而不只是部署之后。现在模型已经足够聪明,如果你在训练阶段不做好,我们在其他实验室看到的那些安全和安全事故,大多数都发生在训练过程中,而不是部署给用户使用之后。

你需要为它制定一套非常好的"课程",就像父母教孩子一样,需要设定明确的边界。如果它做了错误的事,它需要学到"不,你应该真正去解决这个编程问题,而不是通过修改某个系统配置来绕过它、获得奖励"——我想要你通过实际的解题过程来学会这个方法,这才是训练的意义所在。

这很大程度上是关于建立良好的安全机制和明确的边界。这些都是行业必须去做的自然工作,我们正在投入大量时间,每天情况都不一样。

主持人: 我还记得您说过,AI 安全这个问题——感觉最近两周突然成为焦点,但其实没有什么单一事件触发了这个时机。听起来您的意思是,我们其实多花了几个月时间在内部做训练。

马克: 对于 Muse,我们知道这个产品需要非常注重隐私和安全。我们有一个早期版本的模型,认为可以进一步训练一些关于"信息披露尺度"的行为——就像我们之前聊到的那些。所以我们花时间去做了。同时也花时间把虚拟机做得更安全。这多花了几个月。

我不太认同某些其他实验室的说法——"我们在承受巨大痛苦以换取放慢速度"。对我来说,那对 Meta 和 Muse 的用户来说都是正确的事。我们想把产品做好,如果产品不够好,对用户不好,对我们也不好——我们不想把东西推出去,给人留下糟糕的第一印象,然后大家就不再有兴趣用了。

我认为,所有实验室都会有非常强的内在动力把这件事做对。如果把激励机制和"极度有价值且安全"这个目标对齐,那就是关键所在。

主持人: 非常感谢您在这个重要的一周抽出时间。

马克: 谢谢您,谢谢。