Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

  新智元报道

  太卷了。

  九月才过去 3 天,就已经有五个前沿模型发布了!

  Anthropic 的 Fable 5.1 和 Mythos 5.1、谷歌的 Gemini 3.8 Flash 和 Cyber,以及 Meta 的 Muse Spark1.3……RSI,肯定已经到来了。

  就在昨晚,谷歌的 Gemini 3.8 Flash 刚成为轻量霸主,Meta 就来踢馆了。

  小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布,它以前沿性能,带来几乎便宜到无需计量的体验。这是我们在编程和智能体工作方面迄今实现的最大飞跃!

  Meta 超级智能实验室的掌舵人 Alexandr Wang 也连发三条X,揭秘了这次「王炸」的核心杀手锏。

  他表示,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少 ~20%,token 消耗减少 ~25%,并且在长周期任务中能更好地保持需求,「用户会明显感受到这次飞跃」。

  Muse Spark 1.3 一发布,昨晚刚发布的 Gemini 3.8 Flash 就略显尴尬了。

  跑分显示,这次 Muse Spark 1.3 的提升更大。

  它不仅在跑分上反超了 GPT-5.6 Sol 和 Fable 5,Max 推理强度下的 Artificial Analysis 智力指数已经达到 62 分,妥妥进入当前第一梯队。

  在五个月里,Meta 已经不知不觉迭代了 4 个 Muse Spark 版本了。

  亚历山大王嘲讽谷歌

  「吸别家模型尾气」

  最近,AI 第一梯队可是非常拥挤。GPT-5.6 把持着王座,Fable 5.1 后来居上,Gemini 3.8 Flash 正弯道超车。

  Muse Spark 1.3 的出现,直接打乱了所有人的阵脚。

  在最能体现模型真实长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3 直接超越 Opus 5 和 GPT-5.6 Sol,还把刚发布的 Gemini 3.8 Flash 甩在身后,拿下了当前的最高分。

  Muse Spark 1.3:75.4 分

  Claude Opus 5:74.0 分

  GPT-5.6 Sol:73.0 分

  不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。

  在 SWEAtlas CodeBase QnA,它拿下 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。

  在 Terminal-Bench 2.1 它拿下 88.8 分。

  在 MRCR 512K-1M 上,它居然拿到惊人的 98.1 分!(作为对比,GPT-5.6 Sol 在这项上仅有 73.8 分,简直是碾压)。

  在 Agent 能力上,它也基本追平了最前沿的水平,在 JobBench、OSWorld 等测试中与 Opus 5 仅剩几个百分点的微弱差距。

  在 Artificial Analysis 上,Muse Spark 1.3 把 Gemini 3.8 Flash 明显甩在身后。

  在智能指数上,它获得了 62 分,与 Claude Fable 5 持平,跻身顶尖行列。

  而在最受开发者关注的成本方面,Muse 的输入成本比 Fable 5 低 8 倍,输出成本低近 12 倍,性价比拉满。

  面对如此亮眼的战绩,Meta 的首席 AI 官 Alexandr Wang 直接阴阳起来:「在 Artificial Analysis 智能指数上,Gemini 啥也不是,只能吃别家模型的汽车尾气。」

  谷歌真是虎落平阳。

  有人戏称:「谷歌辛辛苦苦四个月发了 4 个 Gemini Flash 版本,Meta 这边五个月里一口气迭代了 4 个 Muse Spark⁺。但谷歌刚领跑了几个小时,就被 Meta 超车了,这剧情太精彩了。」

  Less is More:1 美元跑 2 小时的性能怪兽

  跑分高固然厉害,但在如今的 AI 圈,真正让开发者兴奋的,永远是好用且便宜。

  Muse Spark 1.3 之所以被称为性价比之王,是因为它不仅跑得快,还特别会省钱。

  正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零头」。

  它走了一条与以往大模型「大力出奇迹、疯狂堆叠参数」完全不同的路——做减法。

  针对长周期编程和更优的指令遵循能力,Muse Spark 1.3 进行了专门训练,从而减少不必要的交互轮次,并让输出更加简洁。

  它变得更聪明利落,代码风格更干净,废话更少。

  而这种减法带来的直接后果,就是成本的断崖式下跌。

  下面就是一个非常震撼的真实实测案例。

  开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与 Fable 5.1 xHigh 进行了对比。

  他给出的 Prompt 中包含一条严苛的「自我改进规则」:如果独立评委的评分低于 9.5/10,智能体必须继续改进代码并重新尝试。

  这两个模型都运行了大约 2 个小时,结果惊人。

  Muse Spark 1.3 简直像一个不知疲倦的超级打工人,它根本停不下来,足足进行了 20 轮自我改进循环,每次启动 3 个智能体——相当于在 2 小时内跑了 60 多次智能体运行。

  而完成这极其庞大、复杂的长程推理任务,总成本竟然不到 1 美元!

  这位开发者惊呼:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」

  在宏观定价上,Meta 展现出了极大的诚意。新模型加量不加价,维持了每百万 token 输入 1.25 美元、输出 4.25 美元的定价。

  在定价上,Muse Spark 1.3 的贡献者版「muse-spark-1.3-contributor」更是国外模型定价的地板。(代价,就是要把数据用于改进 Meta 的产品。)

  Codedamn 创始人、开发者 Mehul Mohan 直呼:

  Muse Spark 1.3 的贡献者层定价简直离谱得不真实,这就是美国 AI 实验室的「DeepSeek 定价时刻」。

  在 Artificial Analysis 的统计中,在同等智力水平(得分 59 以上)的模型里,Muse Spark 1.3 的单任务成本仅为 0.55 美元,是绝对的最优解。

  作为对比,同等智力(61 分)的 Grok 4.6 成本为 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高达 1.23 美元。

  甚至,开发者 Kartik 指出,Muse Spark 1.3 似乎具备了类似于 Sol 和 Fable 的「循环深度」推理能力。

  它不是在一瞬间生成答案,而是懂得在内部进行逻辑推演,这使得它的 token 效率高得惊人。

  Alexandr Wang 的狂飙,小扎的终极野心

  Muse Spark 1.3 的横空出世,离不开其背后的操盘手。

  今年 7 月,Meta 发布 Muse Spark 1.1,主打的是 1M 超长上下文和计算机操作。

  短短不到两个月,1.3 版本就已经把长程编码能力推到了 GPT-5.6 的档次。

  如此快速的迭代,正是 Alexandr Wang 接手 Meta 超级智能实验室后带来的成果。

  他们的终极目标是什么?正如小扎和 Alexandr Wang 反复强调的两个词:「智能体」和「便宜到忽略不计」。

  也就是说,Meta 看下一个 ASI 风口——「智能体工程」。

  Meta AI 负责人 Alexandr Wang 在接受 Axios 采访时明确表示,所有的可用性改进,都是为了服务小扎多次提及的宏伟蓝图——打造 7×24 小时在线的个人智能体。

  要想让一个智能体 24 小时帮你处理邮件、写代码、分析数据,它必须具备两个条件。

  1. 极度聪明且稳定:它需要撑住极长的对话线程(长线程),能够并行处理多个工作流。

  当指令模糊时,它要懂得主动提问;当遇到阻碍时,它要懂得向人类求助;在执行关键操作前,它要懂得确认。最重要的是,不产生幻觉。

  2. 极度便宜:如果个人智能体运行一天的成本高达几十美元,那它永远只能是少数人的玩具。

  Muse Spark 1.3 的出现,本质上就是为 7×24 小时个人智能体铺路。

  它就像一个成熟的资深工程师,你给一个目标,它就能自己规划、自己纠错、自己交付。

  为此,北大校友、Meta 研究员孙之清透露 Meta 团队对此前的牛油果 avocado 模型再次后训练,实现了更好的测试 scaling。

  狂欢背后:我们被「刷榜」骗了吗?

  不过,Muse Spark 1.3 也同样受到了质疑。

  知名 AI 机构 BridgeMind 发了一段引人深思的话:

  Gemini 3.8 Flash 和 Muse Spark 1.3 今天同时发布。两者在基准测试上看起来都很出色。

  Muse Spark 1.3 目前在智能指数上与 Fable 5 并列……我想感到兴奋。但我没有。

  因为,这个月的 AI 发布如出一辙,分数飙升,真实世界的体验却毫无长进。

  这令人沮丧。我对基准测试的信任每周都在减少,而对那些玩弄基准的实验室,我的信任更是所剩无几。

  这段话,精准地击中了当前大模型行业的痛点。

  有网友对 Muse Spark 1.3、Gemini Flash 3.8z 在后端级 3D 约束下做了压力测试,结果两个模型的老底都被揭穿了:

  Muse Spark 1.4 并没有那么好,而 Gemini Flash 3.5 纯纯在刷榜。

  现在,各大实验室已陷入「为了跑分而训练」的怪圈。一个模型发布,必定伴随着几张吊打友商的雷达图和排行榜截图。

  DeepSWE、Tau3-Bench、GPQA,成了各家疯狂「刷题」的目标。

  而 Muse Spark 1.3 也露出了马脚。

  在 Artificial Analysis 的深度报告中,我们也能看到它的一丝退步。

  比如,在 AA-Omniscience 测试中,xhigh 和 max 版本都有所下降。原因是它的「弃权率」变高了——当它不确定时,它更倾向于不回答,而不是胡编乱造。

  这降低了幻觉率,但也侧面说明,它的绝对知识储备并没有像跑分提升得那么夸张。

  大模型的下半场,到底比什么?

  今天 Muse Spark 1.3 和 Gemini 3.8 Flash 的发布,可以让我们得出以下几个判断。

  首先,基座模型的「参数红利」正在见顶。

  单纯靠扩大参数规模来提升智力的路径,边际效益已经越来越低。

  未来,谁能像 Muse Spark 1.3 一样,在系统架构上引入类似「循环深度」的推理机制,在工具调用上做极致的「减法」,谁就能获得真正的体验跃升。

  另外,「智能体工程」才是胜负手。

  大模型之争,已经从「谁更会说话」转向「谁更能干活」。

  未来的核心壁垒不是单一跑分,而是在极低成本下,长程任务的真实落地能力。

  像 Muse Spark 1.3 这样,用不到 1 美元跑完 60 次试错循环的模型,将彻底重塑商业模式。

  参考资料:

  https://x.com/SPAC89/status/2095284969614475744

  https://research.meta.ai/blog/introducing-muse-spark-1-3

  https://x.com/AIatMeta/status/2095234385129963666?s=20

  https://artificialanalysis.ai/zh/models/muse-spark-1-3

  https://x.com/EdwardSun0909/status/2095236891574780275?s=20

  编辑:Aeneas