Meta新模型逼平Fable 5,小扎:开源且便宜到你懒得算账

  闻乐发自凹非寺

  量子位 | 公众号 QbitAI

  小扎去年撒出去的那些钱,好像终于开始听见响了……

  Meta 刚刚端出的新模型 Muse Spark 1.3,已经和 Fable 5 掰上手腕了。

  Artificial Analysis 最新榜单里,Muse Spark 1.3 Max 拿到 62 分。

  跟 Fable 5、5.1 xhigh 打了个平手。

  再往细项里扒,Coding 和 Agent 这边 Muse Spark 1.3 已经开始在综合评分比自己高的 Opus5 max 面前冒头。

  这事儿搁 Meta 身上,节目效果就不太一样了。

  在 Llama 之后,Meta 在顶流大模型赛道沉寂挺久,一度被对手甩开一大截。

  就在不久前,小扎去年花重金攒起来的超级智能团队,还经历了余家辉离职的“变故”。

  去年还在满硅谷挥着支票薅人,今年先跑了个核心研究员,这支高价攒出来的队伍,不会要高开低走吧?

  正当大家继续围观这支天价团队后续剧情时——

  新模型先上桌了。

  Muse Spark 1.3:能肝,还贼便宜

  9 月 2 日,Meta 正式发布Muse Spark 1.3

  这是 Muse Spark 今年 4 月亮相之后,短短几个月里的第四个版本。

  4 月,初代 Muse Spark;7 月,1.1;8 月,1.2;现在刚进 9 月,1.3 又续上了。

  小扎这次也亲自营业,称 Muse Spark 1.3 是目前整个系列在Coding 和 Agent工作上幅度最大的一次提升。

  还放狠话,性能已经强到——

  便宜得几乎都没必要算账了。

  按自家给出的内部对比里,Muse Spark 1.3 比 1.2平均减少了约 20% 的工具调用和 25% 的 Token 消耗,同时会少浪费一些无效轮次,在长程任务里也更能记住一开始的要求。

  网友也纷纷开始实测。

  比如拿 Muse Spark 1.3 和 1.2 做一轮同 Prompt 对比。

  一次性生成一个自包含 HTML 文件,在里面搓出三件可收藏的 3D 维京手办,维京头盔、镶钻战斧,以及一艘载着船员的长船。

  成本差不多,一个 0.08 美元,一个 0.1 美元,但 1.3 做出来的细节质感明显高出一截。

  还有网友直接把 Muse Spark 1.3 Ultra Contributor 和 Fable 5.1 xHigh 拉来折腾了差不多两个小时。

  两边拿到同一个 Prompt,但里面专门塞了一条相当折腾模型的规则:

  每次完成之后,都交给独立 Judge 打分。不到 9.5/10 不准停,继续自己改。

  然后 Muse Spark 1.3 真就没停……两小时里,它连续跑了 20 轮自我改进,每一轮又启动 3 个 Agent,算下来就是一共 60+ 次 Agent 运行。

  而且全程花费不到 1 美元。

  总结下来就是:真能肝,真能省

  Muse Spark 1.3 标准 API 价格仍然和 1.2 保持一致:

  输入 1.25 美元/百万 Token,输出 4.25 美元/百万 Token,缓存输入 0.15 美元。

  Artificial Analysis 算下来,1.3 xhigh 每个 Intelligence Index 任务的成本约 0.55 美元。

  同一档附近的 GPT-5.6 Sol Max 和 Grok 4.6 High 分别约 0.95 美元和 0.94 美元。

  而且,Muse Spark 本身还只是 Muse 系列里更轻量的一条模型线,后面还有更大的模型。

  小扎这次发完 1.3,也没忘了继续预告两件事:

  Muse Spark 开放权重,即将到来。

  以及那个已经吊了大家不知道多久胃口的:

  曾经一度在前沿模型竞争里显得有点安静的 Meta,又开始往桌子中央挤了。

  Muse Spark 这几个月突然加速的另一面,是小扎去年那场轰轰烈烈的抢人大战,也终于到了看成果的时候。

  小扎去年薅来的那帮人,开始交作业了

  去年夏天,Meta 组建超级智能实验室,小扎满硅谷挖牛人。

  其中相当受关注的一批研究员,就是从 OpenAI 过去的赵晟佳、余家辉、任泓宇、毕树超等人。

  各种天价 package 传闻满天飞,所有人都在吃瓜:

  这支豪华班子究竟能搞出什么黑科技?

  谁料黑科技还没来,剧情先拐了一下,余家辉宣布离开 Meta 创业。

  一位核心研究员离开,自然让外界重新开始打量这支组建时间并不算长的明星团队。

  不过现在再看,进度没落下。

  而且新版本一出,几位核心研究员也纷纷出来爆料背后改动。

  赵晟佳直接把 Muse Spark 1.3 称为目前 Spark 模型线里最强的 Coding 和 Agent 模型。

  他特别提到了三个方向:

  更长程的工作、更强的 Agent 任务能力,以及更可靠地遵循复杂指令。

  毕树超披露的东西则更底层一点。

  这次团队在训练阶段投入了更多算力做结果评分矫正

  针对性解决模型偷懒划水、指令执行偏差、含糊回避作答,还有奖励投机、奖励黑客等问题。

  经过这轮处理之后,模型的可用性有了非常明显的提升。

  虽然 Muse Spark 1.3 挺猛,但小扎显然还没准备把牌一次打完。

  那个已经预告不知道多少次、到现在还没切开的瓜,到底还能整出多大动静……蹲蹲蹲。

  [1]https://x.com/finkd/status/2095232032896946311?s=20

  [2]https://x.com/aimlapi/status/2095248072154701847?s=20

  [3]https://x.com/SPAC89/status/2095284969614475744?s=20

  [4]https://x.com/shengjia_zhao/status/2095233023247880590?s=20

  [5]https://x.com/shuchaobi/status/2095234300199543121?s=20