闻乐发自凹非寺
量子位 | 公众号 QbitAI
小扎去年撒出去的那些钱,好像终于开始听见响了……
Meta 刚刚端出的新模型 Muse Spark 1.3,已经和 Fable 5 掰上手腕了。
Artificial Analysis 最新榜单里,Muse Spark 1.3 Max 拿到 62 分。
跟 Fable 5、5.1 xhigh 打了个平手。

再往细项里扒,Coding 和 Agent 这边 Muse Spark 1.3 已经开始在综合评分比自己高的 Opus5 max 面前冒头。

这事儿搁 Meta 身上,节目效果就不太一样了。
在 Llama 之后,Meta 在顶流大模型赛道沉寂挺久,一度被对手甩开一大截。
就在不久前,小扎去年花重金攒起来的超级智能团队,还经历了余家辉离职的“变故”。
去年还在满硅谷挥着支票薅人,今年先跑了个核心研究员,这支高价攒出来的队伍,不会要高开低走吧?
正当大家继续围观这支天价团队后续剧情时——
新模型先上桌了。
Muse Spark 1.3:能肝,还贼便宜
9 月 2 日,Meta 正式发布Muse Spark 1.3
这是 Muse Spark 今年 4 月亮相之后,短短几个月里的第四个版本。
4 月,初代 Muse Spark;7 月,1.1;8 月,1.2;现在刚进 9 月,1.3 又续上了。
小扎这次也亲自营业,称 Muse Spark 1.3 是目前整个系列在Coding 和 Agent工作上幅度最大的一次提升。
还放狠话,性能已经强到——
便宜得几乎都没必要算账了。

按自家给出的内部对比里,Muse Spark 1.3 比 1.2平均减少了约 20% 的工具调用和 25% 的 Token 消耗,同时会少浪费一些无效轮次,在长程任务里也更能记住一开始的要求。
网友也纷纷开始实测。
比如拿 Muse Spark 1.3 和 1.2 做一轮同 Prompt 对比。
一次性生成一个自包含 HTML 文件,在里面搓出三件可收藏的 3D 维京手办,维京头盔、镶钻战斧,以及一艘载着船员的长船。
成本差不多,一个 0.08 美元,一个 0.1 美元,但 1.3 做出来的细节质感明显高出一截。

还有网友直接把 Muse Spark 1.3 Ultra Contributor 和 Fable 5.1 xHigh 拉来折腾了差不多两个小时。
两边拿到同一个 Prompt,但里面专门塞了一条相当折腾模型的规则:
每次完成之后,都交给独立 Judge 打分。不到 9.5/10 不准停,继续自己改。
然后 Muse Spark 1.3 真就没停……两小时里,它连续跑了 20 轮自我改进,每一轮又启动 3 个 Agent,算下来就是一共 60+ 次 Agent 运行。
而且全程花费不到 1 美元。

总结下来就是:真能肝,真能省
Muse Spark 1.3 标准 API 价格仍然和 1.2 保持一致:
输入 1.25 美元/百万 Token,输出 4.25 美元/百万 Token,缓存输入 0.15 美元。
Artificial Analysis 算下来,1.3 xhigh 每个 Intelligence Index 任务的成本约 0.55 美元。
同一档附近的 GPT-5.6 Sol Max 和 Grok 4.6 High 分别约 0.95 美元和 0.94 美元。
而且,Muse Spark 本身还只是 Muse 系列里更轻量的一条模型线,后面还有更大的模型。
小扎这次发完 1.3,也没忘了继续预告两件事:
Muse Spark 开放权重,即将到来。
以及那个已经吊了大家不知道多久胃口的:

曾经一度在前沿模型竞争里显得有点安静的 Meta,又开始往桌子中央挤了。
Muse Spark 这几个月突然加速的另一面,是小扎去年那场轰轰烈烈的抢人大战,也终于到了看成果的时候。
小扎去年薅来的那帮人,开始交作业了
去年夏天,Meta 组建超级智能实验室,小扎满硅谷挖牛人。
其中相当受关注的一批研究员,就是从 OpenAI 过去的赵晟佳、余家辉、任泓宇、毕树超等人。
各种天价 package 传闻满天飞,所有人都在吃瓜:
这支豪华班子究竟能搞出什么黑科技?
谁料黑科技还没来,剧情先拐了一下,余家辉宣布离开 Meta 创业。
一位核心研究员离开,自然让外界重新开始打量这支组建时间并不算长的明星团队。
不过现在再看,进度没落下。
而且新版本一出,几位核心研究员也纷纷出来爆料背后改动。
赵晟佳直接把 Muse Spark 1.3 称为目前 Spark 模型线里最强的 Coding 和 Agent 模型。
他特别提到了三个方向:
更长程的工作、更强的 Agent 任务能力,以及更可靠地遵循复杂指令。

毕树超披露的东西则更底层一点。
这次团队在训练阶段投入了更多算力做结果评分矫正
针对性解决模型偷懒划水、指令执行偏差、含糊回避作答,还有奖励投机、奖励黑客等问题。
经过这轮处理之后,模型的可用性有了非常明显的提升。

虽然 Muse Spark 1.3 挺猛,但小扎显然还没准备把牌一次打完。
那个已经预告不知道多少次、到现在还没切开的瓜,到底还能整出多大动静……蹲蹲蹲。
[1]https://x.com/finkd/status/2095232032896946311?s=20
[2]https://x.com/aimlapi/status/2095248072154701847?s=20
[3]https://x.com/SPAC89/status/2095284969614475744?s=20
[4]https://x.com/shengjia_zhao/status/2095233023247880590?s=20
[5]https://x.com/shuchaobi/status/2095234300199543121?s=20
